// TECHNISCHER HINWEIS · GB10 THERMISCHES VERHALTEN
Der NVIDIA DGX Spark verwendet den GB10 Superchip — Blackwell-Architektur, Rechenleistungsklasse sm_121 (in einigen älteren CUDA-Toolchains als sm_90). Unter anhaltenden Inferenz- oder Trainingslasten stabilisiert sich der GB10 in den unteren 80 °C auf unbestimmte Zeit. Die Ursache ist kein Hardwaredefekt, sondern eine Designentscheidung. Die Kühlungshebel, die eine typische NVIDIA-GPU freigibt, sind auf diesem Silizium nicht vorhanden.
Sowohl die Leistungsobergrenze als auch die Lüftersteuerung liefern
[N/A] von nvidia-smi:
$ nvidia-smi --query-gpu=power.limit,power.max_limit,power.min_limit,fan.speed --format=csv,noheader [N/A], [N/A], [N/A], [N/A]
Diese Schnittstellen sind nicht "versteckt" oder hinter sudo abgesichert — sie sind in der GB10-Treiberschnittstelle schlicht nicht implementiert. Die Firmware verwaltet beide Dimensionen intern nach Temperatur- und Lastzustand. Keine Benutzerkonfiguration ändert das.
--lock-gpu-clocksDer einzige Hebel, der doch reagiert, ist die Grafiktakt-Obergrenze.
Obwohl nvidia-smi --query-supported-clocks=graphics auf GB10
[N/A] liefert, akzeptiert der Treiber weiterhin beliebige ganzzahlige
MHz-Werte innerhalb des Betriebsbereichs des Siliziums über
--lock-gpu-clocks:
$ sudo nvidia-smi -lgc 1500,2000 -i 0 GPU clocks set to "(gpuClkMin 1500, gpuClkMax 2000)" for GPU 0000000F:01:00.0 All done.
Die Referenz-Obergrenze auf unserer Produktionshardware liegt bei ~3003 MHz.
Das akzeptierte Minimum liegt bei etwa 900 MHz. Zwischenschritte werden respektiert.
-rgc setzt auf Werkseinstellung zurück. Beide Befehle wirken sofort.
Da nur die Firmware entscheidet, wann heruntergetaktet wird, und dies konservativ tut (vermeidet SW-slowdown, verfolgt kein beliebiges Temperaturziel), stabilisiert sich ein DGX Spark, der Ollama bei 90+ % Auslastung bedient, in den unteren 80 °C und bleibt dort auf unbestimmte Zeit. Der Benutzer kann die Firmware nicht zu aggressiverem Verhalten anweisen. Der einzige verbleibende Aktor ist die Grafiktakt-Obergrenze.
Wir haben einen kleinen Daemon gebaut, der alle 30 Sekunden die GPU-Temperatur
abtastet und die Taktobergrenze in 150-MHz-Schritten mit Drei-Band-Hysterese
verschiebt: Herunterschritt beim Eintritt in das Warnband, Halten
im Zielband, Hochschritt nach drei aufeinanderfolgenden kalten Samples.
Auf unserem Produktions-GB10 (spark-23) sank die anhaltende Temperatur um
11 °C bei gleicher 94 % Auslastung. Der vollständige Mechanismus und die
Lizenzbedingungen finden Sie auf der Produktseite:
thermal.zctechnologies.org. Live-Telemetrie:
/live-telemetry.html. Referenz zum tatsächlichen
Verhalten von -lgc auf GB10:
/nvidia-smi-lgc-on-gb10.html.
Veröffentlicht von C.R. Burrell LLC. Geschrieben für Ingenieure, die DGX Sparks in Produktion betreiben. Korrekturen willkommen: [email protected].