// 기술 노트 · GB10 열 거동

DGX Spark의 GB10이 지속 부하에서 뜨거워지는 이유

NVIDIA DGX Spark는 GB10 슈퍼칩(Blackwell 아키텍처, 컴퓨트 능력 sm_121, 일부 초기 CUDA 툴체인에서는 sm_90)을 사용합니다. 지속적인 추론 또는 훈련 워크로드에서 GB10은 80°C 초반에 무기한 안정화됩니다. 하드웨어 결함이 아니라 설계 선택입니다. 일반적인 NVIDIA GPU가 노출하는 냉각 레버가 이 실리콘에는 존재하지 않습니다.

빠진 부분

전력 한계와 팬 제어 모두 nvidia-smi에서 [N/A]를 반환합니다.

$ nvidia-smi --query-gpu=power.limit,power.max_limit,power.min_limit,fan.speed --format=csv,noheader
[N/A], [N/A], [N/A], [N/A]

이 인터페이스들은 "숨겨진" 것도 sudo 뒤에 놓인 것도 아닙니다. 단순히 GB10 드라이버 인터페이스에 구현되지 않은 것입니다. 펌웨어가 온도와 워크로드 상태에 따라 두 차원을 내부적으로 관리합니다. 사용자 영역의 어떤 설정도 이를 바꿀 수 없습니다.

여전히 작동하는 것: --lock-gpu-clocks

응답하는 유일한 레버는 그래픽 클럭 상한입니다. nvidia-smi --query-supported-clocks=graphics가 GB10에서 [N/A]를 반환함에도, 드라이버는 --lock-gpu-clocks를 통해 실리콘 동작 범위 내의 임의의 정수 MHz 값을 여전히 받아들입니다.

$ sudo nvidia-smi -lgc 1500,2000 -i 0
GPU clocks set to "(gpuClkMin 1500, gpuClkMax 2000)" for GPU 0000000F:01:00.0
All done.

운영 하드웨어에서의 참조 상한은 약 3003 MHz, 받아들여지는 최소값은 약 900 MHz이며 그 사이의 단계도 존중됩니다. -rgc는 스톡으로 재설정합니다. 두 명령 모두 즉시 적용됩니다.

결과: 지속 발열이 기본 운영 체제

펌웨어만 클럭 다운을 언제 할지 결정하며 보수적으로 동작하기 때문(SW-slowdown 회피만 하고 임의의 온도 목표는 추적하지 않음), Ollama를 90% 이상 사용률로 서빙하는 DGX Spark는 80°C 초반에서 무기한 안정화됩니다. 사용자는 펌웨어에 더 공격적으로 동작하라고 요청할 수단이 없습니다. 남은 유일한 액추에이터가 그래픽 클럭 상한입니다.

우리가 하는 일

30초마다 GPU 온도를 샘플링하고 3-밴드 히스테리시스로 클럭 상한을 150 MHz 단위로 조정하는 작은 데몬을 만들었습니다. 경고 밴드 진입 시 단계 하락, 목표 밴드에서는 유지, 연속 3 회 냉각 샘플 후 단계 상승. 운영 GB10 노드(spark-23)에서 동일한 94% 사용률에서 지속 온도가 11°C 하락했습니다. 전체 메커니즘과 라이선스 조건은 제품 페이지에 있습니다: thermal.zctechnologies.org. 실시간 텔레메트리: /live-telemetry.html. GB10에서 -lgc 실제 동작 참조: /nvidia-smi-lgc-on-gb10.html.


C.R. Burrell LLC 발행. DGX Spark를 운영 환경에서 사용하는 엔지니어를 위해 작성. 정정 요청: [email protected].