// TECHNISCHER HINWEIS · GB10 THERMISCHES VERHALTEN

Warum der GB10 des DGX Spark unter Dauerlast heiß wird

Der NVIDIA DGX Spark verwendet den GB10 Superchip — Blackwell-Architektur, Rechenleistungsklasse sm_121 (in einigen älteren CUDA-Toolchains als sm_90). Unter anhaltenden Inferenz- oder Trainingslasten stabilisiert sich der GB10 in den unteren 80 °C auf unbestimmte Zeit. Die Ursache ist kein Hardwaredefekt, sondern eine Designentscheidung. Die Kühlungshebel, die eine typische NVIDIA-GPU freigibt, sind auf diesem Silizium nicht vorhanden.

Was fehlt

Sowohl die Leistungsobergrenze als auch die Lüftersteuerung liefern [N/A] von nvidia-smi:

$ nvidia-smi --query-gpu=power.limit,power.max_limit,power.min_limit,fan.speed --format=csv,noheader
[N/A], [N/A], [N/A], [N/A]

Diese Schnittstellen sind nicht "versteckt" oder hinter sudo abgesichert — sie sind in der GB10-Treiberschnittstelle schlicht nicht implementiert. Die Firmware verwaltet beide Dimensionen intern nach Temperatur- und Lastzustand. Keine Benutzerkonfiguration ändert das.

Was noch funktioniert: --lock-gpu-clocks

Der einzige Hebel, der doch reagiert, ist die Grafiktakt-Obergrenze. Obwohl nvidia-smi --query-supported-clocks=graphics auf GB10 [N/A] liefert, akzeptiert der Treiber weiterhin beliebige ganzzahlige MHz-Werte innerhalb des Betriebsbereichs des Siliziums über --lock-gpu-clocks:

$ sudo nvidia-smi -lgc 1500,2000 -i 0
GPU clocks set to "(gpuClkMin 1500, gpuClkMax 2000)" for GPU 0000000F:01:00.0
All done.

Die Referenz-Obergrenze auf unserer Produktionshardware liegt bei ~3003 MHz. Das akzeptierte Minimum liegt bei etwa 900 MHz. Zwischenschritte werden respektiert. -rgc setzt auf Werkseinstellung zurück. Beide Befehle wirken sofort.

Konsequenz: dauerhafte Wärme ist der Standardbetriebszustand

Da nur die Firmware entscheidet, wann heruntergetaktet wird, und dies konservativ tut (vermeidet SW-slowdown, verfolgt kein beliebiges Temperaturziel), stabilisiert sich ein DGX Spark, der Ollama bei 90+ % Auslastung bedient, in den unteren 80 °C und bleibt dort auf unbestimmte Zeit. Der Benutzer kann die Firmware nicht zu aggressiverem Verhalten anweisen. Der einzige verbleibende Aktor ist die Grafiktakt-Obergrenze.

Unsere Lösung

Wir haben einen kleinen Daemon gebaut, der alle 30 Sekunden die GPU-Temperatur abtastet und die Taktobergrenze in 150-MHz-Schritten mit Drei-Band-Hysterese verschiebt: Herunterschritt beim Eintritt in das Warnband, Halten im Zielband, Hochschritt nach drei aufeinanderfolgenden kalten Samples. Auf unserem Produktions-GB10 (spark-23) sank die anhaltende Temperatur um 11 °C bei gleicher 94 % Auslastung. Der vollständige Mechanismus und die Lizenzbedingungen finden Sie auf der Produktseite: thermal.zctechnologies.org. Live-Telemetrie: /live-telemetry.html. Referenz zum tatsächlichen Verhalten von -lgc auf GB10: /nvidia-smi-lgc-on-gb10.html.


Veröffentlicht von C.R. Burrell LLC. Geschrieben für Ingenieure, die DGX Sparks in Produktion betreiben. Korrekturen willkommen: [email protected].