虎嗅

Pourquoi le refroidissement liquide peut-il devenir un nouveau point de croissance pour les puces de simulation ?

原文:液冷为什么能成为模拟芯片新增长点

L'histoire de la “réduction de la température” des serveurs AI : comment le refroidissement liquide redéfinit la chaîne industrielle des puces lorsque le refroidissement par air échoue ?

Bonjour à tous, je suis votre journaliste financier. Aujourd'hui, nous allons parler d'un sujet qui peut sembler un peu technique, mais qui est directement lié à l'expérience future de l'utilisation de l'IA par tous : la révolution du refroidissement des serveurs AI.

Si vous suivez les nouvelles technologiques, vous avez sûrement entendu parler de la puissance des nouveaux processeurs NVIDIA, mais peu de gens se rendent compte que, pour éviter que ces puces puissantes ne surchauffent, les data centers sont en train de passer d'un système de refroidissement par ventilateurs à un système de refroidissement par eau. Cette évolution ne change pas seulement l'apparence des data centers, elle offre également de nouvelles opportunités considérables aux fabricants de puces analogiques du secteur des semi-conducteurs.

Voici une analyse simplifiée de cette nouvelle, pour vous expliquer la logique et les opportunités commerciales qui en découlent.

---

I. Pourquoi les ventilateurs ne suffisent-ils plus ? La “crise de chaleur” des puces AI

Tout d'abord, il est important de comprendre le contexte : pourquoi le refroidissement par eau est-il devenu nécessaire ?

Imaginez qu'il y a 25 ans, une armoire de serveur standard consommait seulement 5 kilowatts d'énergie, ce qui équivaut à l'ensemble des climatiseurs d'une maison allumés en même temps. À l'époque, il suffisait d'installer quelques grands ventilateurs pour dissiper la chaleur.

Mais aujourd'hui, avec l'explosion des grands modèles d'IA, le nombre de GPU (processeurs graphiques, au cœur du calcul AI) a augmenté de façon exponentielle, et la consommation d'énergie par puce a également grimpé. Les armoires de serveur consomment désormais plus de 100 kilowatts, et ce chiffre pourrait dépasser 1 mégawatt à l'avenir. Qu'est-ce que cela signifie ? Cela équivaut à la consommation d'une petite usine concentrée dans une seule armoire.

À ce stade, il ne suffit plus d'augmenter la vitesse des ventilateurs. Les ventilateurs sont bruyants, consomment beaucoup d'énergie et l'efficacité de la conduction de la chaleur par l'air est trop faible pour évacuer la chaleur produite. Si la température des puces dépasse un certain seuil, non seulement leur performance diminue (rétrogradation de fréquence), mais elles peuvent également être endommagées.

C'est là que le refroidissement par eau entre en jeu. NVIDIA, leader du secteur, a complètement abandonné les ventilateurs dans sa dernière architecture Vera Rubin pour adopter un refroidissement liquide à 100 %. En d'autres termes, les puces sont “habillées” d'un “gilet de refroidissement” à eau, permettant au liquide de refroidissement de circuler directement sur leur surface pour emporter la chaleur. C'est comme boire de l'eau glacée ou se baigner dans une piscine lorsqu'il fait très chaud – une solution beaucoup plus efficace que les ventilateurs.

II. Dans un système de refroidissement liquide, qui assure la surveillance ? L'explosion des capteurs

Un système de refroidissement liquide est beaucoup plus complexe qu'un système de refroidissement par air. Il s'agit d'un système de circulation sophistiqué : le liquide de refroidissement absorbe la chaleur des puces, la transporte vers une unité de distribution (CDU), où il est chauffé et filtré avant de revenir. Tout problème, même minime (fuite dans les tuyaux, panne de pompe, obstruction des filtres), peut entraîner l'arrêt du serveur.

Par conséquent, un système de refroidissement liquide nécessite de nombreux capteurs pour surveiller en permanence les différentes étapes du processus :

1. Capteurs de température (les plus basiques mais essentiels) :

  • Auparavant, nous ne mesurions que la température des puces CPU/GPU elles-mêmes.
  • Aujourd'hui, nous mesurons également la température de l'entrée et de la sortie du liquide de refroidissement. En calculant la différence de température, nous pouvons évaluer l'efficacité du système de refroidissement. Si cette différence diminue, cela indique probablement un problème.
  • Trois types de capteurs sont utilisés : les résistances à platine (RTD, stables mais chères), les résistances thermiques (bon marché et flexibles, idéales pour être fixées sur les tuyaux), et les capteurs de température intégrés (de haute précision, fournissant des données numériques directement).

2. Capteurs de pression et de débit (le “pouls” du système) :

  • La pression est essentielle pour détecter d'éventuelles anomalies dans les tuyaux (vannes mal fermées, filtres bouchés).
  • Le débit du liquide de refroidissement est très élevé (des dizaines à des centaines de litres par minute).
  • La méthode de différence de pression consiste à placer un “résistant de contrôle” dans les tuyaux pour mesurer la différence de pression avant et après le système.
  • Les méthodes ultrasoniques et électromagnétiques sont plus efficaces pour des débits élevés, mais plus complexes.

3. Détecteurs de fuites :

  • Les serveurs à refroidissement par air ne craignent pas les fuites, mais ceux à refroidissement par eau le font. Une fuite de liquide de refroidissement peut être catastrophique pour les circuits imprimés.
  • Des capteurs de fuite sont donc installés à l'intérieur du serveur pour détecter immédiatement toute défaillance.

III. Qui prend les commandes ? Les moteurs devenus un nouveau enjeu majeur

Si les capteurs sont les “yeux” du système de refroidissement, les moteurs en sont les “mains” et les “jambes”.

Les serveurs traditionnels utilisent principalement des ventilateurs, dont les moteurs sont relativement simples. Dans les systèmes de refroidissement par eau, on trouve des pompes pour faire circuler le liquide, des vannes pour contrôler le débit, et parfois même des compresseurs.

  • Les moteurs de pompe doivent être contrôlés avec précision pour adapter la vitesse au niveau de charge du serveur : plus la charge est élevée, plus le débit doit être rapide, afin d'économiser de l'énergie. Cela nécessite des contrôleurs de moteur de haute précision, des composants de pilotage de grille et des MOSFET (transistors de puissance).
  • Les vannes doivent être capables de fonctionner de manière intelligente et de fournir des informations précises sur leur position (utilisant des capteurs Hall, par exemple).
  • L'efficacité énergétique est cruciale : STMicroelectronics (ST) souligne que le système de refroidissement peut représenter jusqu'à 40 % des coûts énergétiques des data centers AI. Ainsi, l'efficacité des moteurs et les stratégies de contrôle sont déterminants.

Cela signifie que les fabricants de puces doivent non seulement vendre des capteurs, mais également des composants complets tels que des puces de pilotage de moteur et des microcontrôleurs (MCU) pour les systèmes de refroidissement.

IV. Les géants et les nouveaux acteurs : comment les fabricants de puces se positionnent-ils sur le marché du refroidissement liquide ?

Face à ce nouveau marché, les grands fabricants de puces ajustent leurs stratégies :

  • TI (Texas Instruments) et NXP (NXP) : des acteurs polyvalents disposant d'une large gamme de composants analogiques (ADC, amplificateurs, interfaces de capteurs) utilisés dans l'automobile, les appareils électroménagers et l'automatisation des bâtiments.
  • Leur approche consiste à “recomposer” ces composants pour les adapter au refroidissement des data centers.
  • Avantages : produits matures, fiabilité élevée, temps de commercialisation rapide. Ils fournissent des “concepts de référence” pour aider les clients à mettre en place des systèmes de surveillance de refroidissement complets.
  • ADI (Analog Devices) : des experts en intégration.
  • ADI a développé des puces spécialisées, comme l'ADT7604, capable de surveiller en même temps la température et les fuites de liquide sur 20 canaux.
  • Avantages : intégration élevée, réduction des circuits externes, adaptée aux espaces restreints des serveurs.
  • STMicroelectronics (ST) et Infineon : des leaders dans les semi-conducteurs de puissance et les composants de pilotage de moteur.
  • Leur expertise se concentre sur le pilotage des pompes et des compresseurs, des composants essentiels dans les systèmes de refroidissement liquide.
  • Allegro : spécialisé dans les capteurs et les composants de pilotage.
  • Allegro ne se concentre pas sur les microcontrôleurs ou les ADC généraux, mais sur les interfaces de capteurs et les composants de pilotage spécifiques aux systèmes de refroidissement.
  • Les fabricants chinois : ils se rapprochent rapidement du marché et cherchent des opportunités.
  • Shengbang Microelectronics a développé le SGM451L, un capteur de température pour serveurs, avec une précision élevée et des fonctionnalités locales et à distance.
  • Naxin Microelectronics a fait du refroidissement liquide une nouvelle direction de développement, avec des produits couvrant la mesure de la pression, de la température et du débit.
  • Actuel état du marché : les produits spécifiques au refroidissement liquide sont encore rares chez les fabricants chinois, mais avec l'expansion des serveurs AI en Chine, ce marché représente un énorme potentiel.

V. Avenir : de la surveillance ponctuelle à l'intégration intelligente

À l'avenir, les systèmes de refroidissement liquide seront plus intelligents, en intégrant plusieurs capteurs et en utilisant de l'IA pour analyser en temps réel les données et prévoir les problèmes.

  • Association des données : les données sur la pression, la vitesse des pompes, le débit, la température et l'humidité sont étroitement liées. Par exemple, une augmentation soudaine du débit de la pompe peut être due à un obstruement dans les tuyaux, et non à une panne de la pompe elle-même.
  • Intelligence embarquée : les unités de distribution de refroidissement (CDU) intégreront des processeurs dotés d'IA pour analyser en temps réel toutes les données et détecter d'éventuelles anomalies.
  • Nouvelles exigences pour les puces : cela signifie une augmentation de la demande en ADC à haute capacité de mesure, en composants de pilotage analogique de haute précision (AFE) et en microcontrôleurs dotés de capacités de calcul à l'edge (edge computing).

Conclusion

Le passage aux systèmes de refroidissement liquide pour les serveurs AI n'est pas seulement une évolution technologique, mais aussi une opportunité majeure pour l'industrie des puces analogiques.

  • Pour les investisseurs : il est intéressant de suivre les entreprises qui possèdent des compétences avancées dans les capteurs de température et de pression, ainsi que dans les composants de pilotage de moteur et les ADC de haute précision. Que ce soit des géants internationaux (TI, ADI, ST, NXP) ou de nouveaux acteurs chinois (Shengbang Microelectronics, Naxin Microelectronics), tous accélèrent leur développement dans ce domaine.
  • Pour l'industrie : le refroidissement liquide deviendra une composante standard des infrastructures AI, et les chaînes industrielles associées (capteurs, pompes, liquides de refroidissement, systèmes de contrôle) connaîtront une croissance à long terme.

En bref, plus l'IA deviendra performante, plus les serveurs chaufferont, et plus le refroidissement liquide sera important – ce qui rendra les puces analogiques encore plus précieuses. C'est la logique fondamentale derrière cette évolution.