第一财经

Les super-nodes ne se contentent pas de processeurs graphiques (GPU) : la compétition en puissance de calcul met à l’épreuve les usines, l’électricité et les moyens de financement.

原文:超节点不只拼GPU:算力竞争考验厂房、电力和融资

Les “barrières invisibles” de la course à l’inférence par intelligence artificielle : lorsque les puces ne sont plus les seules actrices principales

Bonjour à tous, je suis votre journaliste financier. L’article que nous allons aborder aujourd’hui peut être différent de l’image que beaucoup ont de l’intelligence artificielle, qui consiste simplement à acheter des cartes graphiques.

Par le passé, on pensait que pour travailler avec l’IA, il suffisait de voir qui disposait du plus grand nombre de GPU (processeurs graphiques) ou de puces les plus rapides. Cependant, Chen Zhenkuan, un dirigeant du groupe Lenovo, a révélé un détail très concret : les serveurs d’IA actuels sont trop lourds pour être installés dans des bâtiments ordinaires, et ils consomment tant d’énergie que les usines classiques n’en peuvent pas fournir.

Il s’agit là non seulement d’un problème technique, mais aussi d’un changement fondamental dans l’industrie de l’IA : l’infrastructure d’IA évolue d’une compétition axée sur des actifs légers vers une compétition axée sur des actifs lourds. C’est comme si, autrefois, on comparait la luminosité des écrans des téléphones portables, tandis qu’aujourd’hui, on compare la taille des centrales électriques et la solidité des fondations.

Voici comment je vais décomposer cet article en cinq points pour vous expliquer la logique derrière tout cela.

---

1. **Les contraintes physiques : pourquoi les serveurs d’IA doivent-ils être installés au rez-de-chaussée ?**

Auparavant, il était possible de placer des serveurs aux étages, car un serveur n’était pas très lourd et les planches de béton pouvaient supporter jusqu’à une tonne de poids. Mais avec l’apparition des “super-nodes” (unités de calcul haute performance composées de dizaines ou même de centaines de GPU), la situation a changé.

  • Changement de poids : Les super-nodes sont extrêmement lourds. Chen Zhenkuan a indiqué que les nouveaux bâtiments doivent supporter au moins 3 tonnes par mètre carré, voire être conçus pour supporter 5 tonnes. Cela signifie que les équipements doivent être placés au rez-de-chaussée et qu’il est impossible de creuser des garages souterrains (car les fondations doivent être particulièrement profondes et solides).
  • Consommation d’énergie : Une usine de production de super-nodes nécessite au moins 30 mégawatts d’énergie, voire plus. Pour comparaison, une usine classique n’a peut-être besoin que de quelques mégawatts, tandis qu’ici, des installations de transformation de courant de 110 kilovolts sont nécessaires.

Interprétation simple : C’est comme si, auparavant, on pouvait ouvrir un petit restaurant avec la cuisine de sa maison ; maintenant, il faut une cuisine industrielle, des lignes électriques haute tension spéciales et des fondations renforcées pour éviter que les équipements ne détruisent les planches de béton.** Les détails de l’infrastructure physique, tels que l’espace, la capacité de charge et l’énergie, sont devenus les premiers obstacles à la mise en œuvre de l’inférence par intelligence artificielle. De nombreux anciens bâtiments doivent être démolis ou rénovés, ce qui représente un coût considérable.

---

2. **La fusion des frontières technologiques : il ne s’agit plus seulement d’acheter des puces, mais aussi de systèmes complets**

Auparavant, les serveurs, le stockage, les réseaux et les systèmes d’exploitation étaient vendus séparément, avec des frontières claires. On achetait une CPU, de la mémoire, une carte réseau, et on les assemblait. Mais les super-nodes ont brisé ces frontières. Il ne s’agit plus de serveurs indépendants, mais d’un ensemble complexe comprenant :

  • Armoires de calcul : Pour abriter les GPU.
  • Armoires d’énergie : Pour l’alimentation électrique.
  • Armoires de stockage : Pour l’archivage des données.
  • Armoires de connexion : Pour les transferts de données à haute vitesse.

Cela pose un problème de standardisation : il existe 12 fabricants et 13 protocoles différents rien que pour l’interconnexion à haute vitesse au sein des nœuds.

Interprétation simple : Imaginez que vous voulez assembler un ordinateur ; avant, il suffisait que les interfaces soient USB. Aujourd’hui, les prises de chaque fabricant sont différentes (rondes ou carrées, à vitesse variable). Les fabricants de systèmes complets (comme Lenovo ou Huawei) doivent non seulement prendre en compte les puces actuelles, mais aussi prévoir de la place en cas d’évolution des technologies ou de changement de fournisseurs de puces, ce qui implique de réimaginer l’alimentation, le refroidissement et les câbles de connexion.

Conséquence : Ce n’est plus seulement les puces qui sont impactées, mais aussi les composants tels que les puces de commutation, les cartes PCB, les câbles à haute vitesse, les modules d’alimentation et les systèmes de refroidissement.** La complexité technologique augmente exponentiellement, tout comme les coûts de développement.

---

3. **Les nouveaux enjeux financiers : de “gagner autant qu’on dépense” à “emprunter de l’argent pour construire l’infrastructure”

C’est le point le plus surprenant pour le grand public. L’infrastructure d’IA est extrêmement coûteuse, au point que les entreprises ne peuvent pas se le permettre avec leurs seuls revenus.

  • Explosion de l’échelle des investissements : Selon des données de CITIC Construction Investment, pendant les deux dernières décennies de l’ère du mobile, les dépenses en capital aux États-Unis et en Chine étaient d’environ 100 milliards de dollars par an ; cette année, les entreprises de cloud nord-américaines ont dépensé environ 800 milliards de dollars, et en Chine, près de 1 trillion de yuans.** L’investissement a été multiplié par 10, et peut-être même par 20 si l’on inclut l’ensemble de la chaîne d’approvisionnement.
  • Changement des méthodes de financement : Auparavant, les entreprises investissaient après avoir gagné de l’argent ; maintenant, elles doivent emprunter. Les sources de financement se sont diversifiées, avec des outils financiers tels que l’émission d’obligations, le financement par leasing, le capital-risque et les prêts.
  • L’écart des taux d’intérêt est déterminant : Wang Qing de Chongyang Investment souligne que les projets soutenus par de grandes entreprises de cloud (comme Alibaba, Tencent, Microsoft) bénéficient de taux d’intérêt de 5,3 % à 6,6 %, tandis que ceux sans soutien financier enregistrent des taux allant jusqu’à 8,5 % à 9 %.

Interprétation simple : C’est comme si deux promoteurs voulaient construire un immeuble. Le promoteur A (comme Vanke) est considéré comme fiable par les banques et obtient un taux d’intérêt de 5 % ; le promoteur B, considéré comme plus risqué, paie 9 %. Même s’ils construisent le même immeuble, les intérêts supplémentaires payés par le promoteur B peuvent engloutir tous ses profits et même le mener à la faillite.

Dans le contexte de l’infrastructure d’IA, le coût du financement (les taux d’intérêt) est déterminant pour le succès du projet. Une différence de quelques points de pourcentage peut représenter des milliards de yuans de bénéfices. Ainsi, le crédit et la capacité de financement sont devenus des compétences essentielles, tout aussi importantes que la technologie des puces.

---

4. **Une bulle ou l’avenir ? Le décalage entre “l’argent” et “les retours”

La plus grande question actuelle est de savoir si l’IA est une bulle. Wu Chaoze de CITIC Construction Investment souligne un fait cruel : la chaîne industrielle de l’inférence par intelligence artificielle récupère plus de 90 % des revenus et des bénéfices, tandis que les couches de modélisation et d’application continuent de consommer de l’argent et que la commercialisation est lente.

  • Les acteurs de l’aval profitent peu : Ceux qui vendent les composants (puces, serveurs, énergie) gagnent beaucoup, tandis que ceux qui utilisent l’IA pour créer des produits et des services pour les utilisateurs peinent encore à trouver des sources de revenus.
  • Les externalités technologiques : Peng Wensheng du Gaojin Think Tank souligne que l’innovation technologique a des “externalités”. Cela signifie que les investissements dans l’IA peuvent ne pas rapporter de bénéfices immédiats, mais améliorer la productivité de toute la société, bénéficiant ainsi à tous. Si l’on se concentre uniquement sur les résultats financiers à court terme d’une entreprise, on risque de sous-estimer la valeur de l’IA.

Interprétation simple : C’est comme la construction d’une autoroute. Pendant la construction, l’entreprise qui la réalise peut perdre de l’argent ou ne gagner que peu ; mais une fois l’autoroute achevée, ceux qui utilisent les services (camions, voitures, commerces le long de l’autoroute) en profitent grandement.

L’infrastructure d’IA est comme une autoroute menant à l’avenir. La question est de savoir quand le trafic commercial commencera à augmenter. Si l’autoroute reste peu fréquentée pendant 10 ans, l’entreprise qui l’a construite échouera. Mais si le trafic devient dense, la décision de construire l’autoroute sera judicieuse.** Nous sommes actuellement dans une période où l’autoroute est prête, mais le trafic n’est pas encore là.

---

5. **Conclusion finale : il s’agit d’une course de résistance à long terme, impliquant de nombreux facteurs**

En résumé, la “course à l’inférence par intelligence artificielle” n’est plus simplement une compétition de puces. C’est devenue une compétition axée sur des actifs lourds :

  • Premier étape : Obtenir des GPU (puces).
  • Deuxième étape : Assurer un bon stockage (HBM), des connexions et un bon refroidissement.
  • Troisième étape : Disposer de bâtiments, d’énergie et de fondations solides.
  • Quatrième étape : Maîtriser les coûts financiers (taux d’intérêt).
  • Cinquième étape : Produire des retours commerciaux suffisants.

Si un seul élément manque, tout le système s’arrête.

  • Même les puces les plus rapides ne servent à rien sans énergie.
  • Même une énergie abondante ne suffit pas si les bâtiments ne sont pas stables.
  • Même des équipements fiables ne sont pas rentables si les coûts de financement sont trop élevés.
  • Même si les comptes sont rentables, si personne n’achète les services, il s’agit d’une bulle.

Pour le grand public, cela signifie :

1. Les barrières à l’entrée dans l’industrie de l’IA sont très élevées : Il est difficile pour les petits acteurs d’accéder au cœur de l’inférence par intelligence artificielle en achetant simplement quelques cartes graphiques ; c’est le domaine des géants et des nations puissantes.

2. Il faut se concentrer sur l’infrastructure plutôt que seulement sur les modèles : Dans les prochaines années, les entreprises travaillant dans les domaines de l’énergie, des data centers, du refroidissement liquide et des connexions à haute vitesse pourront être plus stables et plus rentables que les entreprises de logiciels.

3. Patience et risques sont nécessaires : Le cycle de retour sur investissement de l’IA a été allongé. Il ne faut pas s’attendre à des bénéfices explosifs l’année prochaine, mais il ne faut pas non plus négliger la valeur de l’infrastructure en raison du manque de retours immédiats. C’est une course de marathon qui requiert de la résistance, des capacités financières et des compétences en ingénierie systémique.

En résumé : La seconde phase de l’IA ne consiste pas à voir qui est le plus intelligent (en termes d’algorithmes), mais à savoir qui dispose des ressources les plus importantes (infrastructure, financement, capacité d’intégration de la chaîne d’approvisionnement).**