// NOTE TECHNIQUE · COMPORTEMENT THERMIQUE GB10
Le NVIDIA DGX Spark utilise la puce GB10 — architecture Blackwell, capacité de calcul sm_121 (ou sm_90 dans certaines chaînes CUDA antérieures). Sous charges soutenues d'inférence ou d'entraînement, le GB10 se stabilise dans les 80 °C bas indéfiniment. La raison n'est pas un défaut matériel ; c'est un choix de conception. Les leviers de refroidissement qu'expose une GPU NVIDIA typique sont absents sur ce silicium.
La limite de puissance et le contrôle du ventilateur renvoient tous deux
[N/A] depuis nvidia-smi :
$ nvidia-smi --query-gpu=power.limit,power.max_limit,power.min_limit,fan.speed --format=csv,noheader [N/A], [N/A], [N/A], [N/A]
Ces interfaces ne sont pas "cachées" ni protégées par sudo ; elles ne sont pas implémentées dans l'interface du pilote GB10. Le firmware gère les deux dimensions en interne selon l'état thermique et de charge. Aucune configuration utilisateur ne les modifie.
--lock-gpu-clocksLe seul levier qui répond effectivement est le plafond d'horloge graphique.
Bien que nvidia-smi --query-supported-clocks=graphics renvoie
[N/A] sur GB10, le pilote accepte toujours des valeurs entières
arbitraires en MHz dans la plage opérationnelle du silicium via
--lock-gpu-clocks :
$ sudo nvidia-smi -lgc 1500,2000 -i 0 GPU clocks set to "(gpuClkMin 1500, gpuClkMax 2000)" for GPU 0000000F:01:00.0 All done.
Le plafond de référence sur notre matériel de production est ~3003 MHz. Le
minimum accepté est d'environ 900 MHz. Les pas intermédiaires sont respectés.
-rgc réinitialise aux valeurs d'usine. Les deux commandes prennent
effet immédiatement.
Comme seul le firmware décide du moment où sous-cadencer, et le fait de manière conservatrice (évite le SW-slowdown, ne poursuit pas d'objectif thermique arbitraire), un DGX Spark servant Ollama à 90+ % d'utilisation se stabilisera dans les 80 °C bas et y restera indéfiniment. L'utilisateur ne peut pas demander au firmware d'être plus agressif. Le seul actionneur restant est le plafond d'horloge graphique.
Nous avons construit un petit démon qui échantillonne la température de la GPU
toutes les 30 secondes et fait évoluer le plafond d'horloge par pas de 150 MHz
avec hystérésis à trois bandes : descendre à l'entrée de la bande
d'avertissement, tenir dans la bande cible, monter après trois
échantillons froids consécutifs. Sur notre GB10 de production (spark-23), la
température soutenue a chuté de 11 °C à la même utilisation de 94 %.
Le mécanisme complet et les conditions de licence sont sur la page produit :
thermal.zctechnologies.org. Télémétrie en direct :
/live-telemetry.html. Référence sur le
comportement réel de -lgc sur GB10 :
/nvidia-smi-lgc-on-gb10.html.
Publié par C.R. Burrell LLC. Rédigé pour les ingénieurs exploitant des DGX Sparks en production. Corrections bienvenues : [email protected].