De la « puissance de calcul » à la « capacité de stockage » : Qui est le maillon faible dans la seconde moitié de la course de l’hardware AI ?
Bonjour à tous, je suis votre journaliste financier et économiste.
Récemment, si vous suivez le monde de la technologie ou le marché boursier, vous avez peut-être remarqué un phénomène intéressant : auparavant, tout le monde parlait d’IA, en se concentrant sur les GPU (cartes graphiques) d’NVIDIA, considérées comme le « cerveau », le noyau essentiel. Mais au second semestre de 2025, la tendance a changé. Les dispositifs de stockage tels que la mémoire RAM (DRAM), la mémoire flash (NAND) et les disques durs, qui étaient auparavant considérés comme des acteurs secondaires, sont soudain devenus les acteurs principaux.
Pourquoi ? Parce que la capacité de stockage est devenue le nouveau goulot d’étranglement.
En bref, auparavant, le problème était que les calculs n’étaient pas assez rapides ; maintenant, il s’agit de ne pas pouvoir stocker suffisamment de données et de ne pas pouvoir les lire assez rapidement. C’est comme un grand cuisinier (la GPU) : même s’il est très habile, s’il ne peut pas récupérer les ingrédients (les données) de la réfrigérateur (la mémoire) assez vite, il ne peut rien faire.
Aujourd’hui, nous allons expliquer, en langage simple, ce rapport approfondi sur l’HBM (High Bandwidth Memory), pour comprendre ce qu’il y a derrière cette révolution de la capacité de stockage et les opportunités commerciales qu’elle offre.
---
I. Pourquoi l’IA consomme-t-elle soudainement autant de mémoire ?
Beaucoup ont une idée fausse : ils pensent que l’IA ne concerne que les calculs et n’a rien à voir avec le stockage. C’est complètement faux. La demande en mémoire de l’IA ne croît pas linéairement, mais exponentiellement. Cela est principalement dû à trois facteurs :
1. Les modèles d’IA deviennent de plus en plus complexes (stockage des paramètres)
Vous pouvez imaginer les grands modèles d’IA comme un dictionnaire extrêmement complexe. Auparavant, ce dictionnaire contenait seulement quelques millions de mots ; aujourd’hui, il en contient des milliards.
- Les données parlent : prenons l’exemple de Qwen. Du premier modèle à la dernière version, Qwen3.8 Max, le nombre de paramètres a augmenté de plus de 30 fois.
- Conséquence : rien que pour stocker ce dictionnaire, la mémoire nécessaire est passée de 135 Go à 2300 Go (environ 2,3 To). Et ce n’est même pas encore le début des opérations ; il occupe déjà une grande place.
2. La mémoire de conversation devient de plus en plus importante (cache KV)
C’est la partie la plus négligée, mais elle consomme beaucoup de mémoire. Plus vous discutez avec l’IA, plus elle a besoin de mémoriser de contexte.
- Parabole : c’est comme si vous discutiez avec un ami et que vous deviez retenir tout ce que vous avez dit pour continuer la conversation.
- Situation actuelle : bien que les technologies logicielles progressent et permettent de compresser les données, la longueur du contexte que peut gérer l’IA atteint désormais des centaines de milliers, voire des millions de mots.
- Effet cumulé : si 32 personnes discutent en même temps avec l’IA, la mémoire nécessaire pour ces conversations atteint 1,3 To. Ajoutez à cela les 2,3 To nécessaires au modèle lui-même, et un seul exemplaire du modèle consomme 3,6 To de mémoire !
3. Les tâches diverses des agents intelligents (AI Agents)
L’IA n’est plus seulement utilisée pour répondre aux questions ; elle peut également écrire du code, manipuler des fichiers Excel ou envoyer des e-mails. Les fichiers temporaires, les journaux et les données intermédiaires générés par ces activités consomment également beaucoup de mémoire, même si ce n’est pas le niveau de performance de l’HBM.
En résumé : Auparavant, être rapide dans les calculs était le plus important ; maintenant, être capable de stocker et de lire rapidement est tout aussi crucial, voire plus important.
---
II. Pourquoi l’HBM est-elle devenue la favorite ? La mémoire ordinaire ne suffit-elle pas ?
Puisque la mémoire est si importante, pourquoi utiliser l’HBM, qui est coûteuse, au lieu de la mémoire DDR5 couramment utilisée dans nos ordinateurs ?
Il faut regarder deux indicateurs clés : la capacité et la vitesse.
1. **Les limites physiques de la mémoire ordinaire**
- Difficultés de fabrication : il est difficile de réduire la taille des puces de mémoire à 2 nm ou 3 nm comme pour les CPU. En raison des lois physiques, les électrons se déplacent de manière aléatoire, ce qui provoque des erreurs. La fabrication des puces de mémoire est actuellement bloquée à 11-12 nm et ne dépassera probablement pas 10 nm dans les prochaines années.
- Espace limité : comme les puces de mémoire ne peuvent pas être agrandies, il faut en placer plusieurs. Cependant, l’espace autour des puces de GPU est très précieux ; il n’est pas possible de disposer les barrettes de mémoire de manière uniforme comme sur une carte mère ordinaire.
2. **La technologie innovante de l’HBM** : le stockage en hauteur
L’ingéniosité de l’HBM réside dans le fait qu’elle ne concurrence pas la surface avec les CPU/GPU, mais qu’elle se stocke en hauteur.
- Stockage vertical : imaginez une mémoire ordinaire disposée en plain-pied, tandis que l’HBM est comme un parking en hauteur construit à côté de la GPU. Elle empile jusqu’à 12 ou 16 couches de puces de mémoire.
- trous de silicium (TSV) : pour relier ces couches, les ingénieurs ont créé de nombreux petits trous verticaux dans les puces et les ont remplis de cuivre pour permettre le transfert des signaux.
- Résultat : sur une surface égale, l’HBM peut contenir plusieurs fois plus de données que la mémoire ordinaire.
3. **Pourquoi la vitesse est-elle si élevée ?**
- Largeur de bus élevée : la mémoire ordinaire ne peut transmettre que 32 bits de données à la fois, tandis que l’HBM peut en transmettre 1024 ou même 2048 bits. C’est comme si une route ordinaire n’avait qu’un seul sens de circulation, tandis qu’une autoroute à 1000 voies permettait un débit beaucoup plus élevé.
- Distance de transmission réduite : l’HBM est directement collée à la puce de GPU (via une couche intermédiaire en silicium). Les données ne doivent pas parcourir de longues distances, ce qui réduit considérablement les retards et augmente la vitesse.
En résumé : L’HBM a été conçue pour résoudre les problèmes de manque d’espace et de lenteur de transmission.
---
III. Les difficultés technologiques de l’HBM : Pourquoi est-elle si difficile à fabriquer et si chère ?
Bien que l’HBM soit avantageuse, sa fabrication est extrêmement complexe, ce qui explique pourquoi elle est plusieurs fois plus chère que la mémoire DDR5. Il y a trois principaux obstacles :
1. **Processus de mise en pile** : une tâche extrêmement précise
- Perforation difficile : il faut créer des milliers de trous verticaux dans une fine couche de silicium, tout en veillant à leur alignement, à la bonne dissipation de la chaleur et à l’alimentation électrique. C’est très complexe.
- Soudure difficile : comment coller ces 12 couches de puces ensemble ?
- SK Hynix utilise la technologie MR-MUF (soudure par reflux + résine liquide). Cela consiste à assembler toutes les couches en une seule fois puis à les solidifier avec de la résine. Avantages : efficacité élevée, taux de réussite élevé, bonne dissipation de la chaleur.
- Samsung/Micron utilisent la technologie TC-NCF (pression thermique + film non conducteur). Cela consiste à presser les couches une par une. Inconvénients : plus de étapes, risques d’erreurs, taux de réussite plus faible.
- Concurrence : SK Hynix, grâce à sa technologie MR-MUF plus avancée, occupe une position dominante sur le marché de l’HBM et réalise des marges plus élevées. Samsung et Micron cherchent à rattraper leur retard en développant de nouvelles technologies de soudure.
2. **Processus de packaging** : une collaboration indispensable avec la GPU
- Couche intermédiaire en silicium (Interposer) : L’HBM ne peut pas être vendue séparément ; elle doit être encapsulée avec la puce de GPU sur une plaque de silicium spéciale.
- Exigences de précision extrêmes : les lignes sur cette plaque de silicium ont une largeur de seulement 1 micron (1/70 de la largeur d’un cheveu) ; les cartes PCB classiques ne peuvent pas être utilisées.
- Capacité de production limitée : cette plaque de silicium et le processus d’encapsulation dépendent principalement de la capacité de production de TSMC (Taiwan Semiconductor Manufacturing Company). Ainsi, le nombre d’unités d’HBM disponibles dépend de TSMC.
3 **Base de la puce (Base Die)** : du standardisé au personnalisé
- Auparavant : la base de l’HBM était simple et pouvait être fabriquée par les fabricants de mémoire.
- Aujourd’hui (HBM4) : la base est devenue très complexe et nécessite des technologies de 12 nm ou plus avancées. Les fabricants de mémoire ne peuvent plus la fabriquer seuls et doivent faire appel à TSMC pour l’usinage.
- Changement crucial : la base n’est plus standardisée. Les grands clients comme NVIDIA et AMD personnalisent leur conception en fonction de leurs besoins.
- Par exemple, l’NVHBM d’NVIDIA utilise des protocoles privés, ce qui augmente la bande passante de 30 % et réduit la consommation d’énergie de 15 %.
- Cela signifie que l’HBM n’est plus un produit standard, mais un composant semi-personnalisé.
---
IV. Le changement majeur dans la chaîne industrielle : les fabricants de mémoire ne dominent plus
Cette révolution de l’HBM a complètement modifié la structure du marché de la mémoire.
1. **Diminution de l’indépendance des fabricants de mémoire**
Auparavant, les fabricants de mémoire (tels que Samsung, SK Hynix, Micron) étaient les acteurs principaux, contrôlant tout du design à la production.
Aujourd’hui, la chaîne de production de l’HBM est divisée en :
- Fabricants de mémoire : responsables de la fabrication des puces de mémoire et de leur mise en pile.
- TSMC : responsable de la fabrication de la base de la puce et de l’encapsulation finale (CoWoS).
- Clients finaux (tels que NVIDIA : participent à la conception de la base de la puce et déterminent les spécifications.
Conséquence : Le pouvoir des fabricants de mémoire a diminué. Si NVIDIA change de fournisseur demain, ou si la capacité de production de TSMC n’est pas suffisante, même les fabricants de mémoire les plus performants ne pourront pas livrer.
2. **Prospérité partagée ou transfert de valeur ?**
- À court terme : avec l’explosion de la demande en IA, le marché s’est agrandi, et tous les acteurs (fabricants de mémoire, TSMC, NVIDIA) en profitent. Les actions de SK Hynix et Micron ont augmenté de 10 fois en six mois, ce qui en est la preuve.
- À long terme : avec l’approfondissement de la personnalisation, les fabricants de mémoire pourraient devenir des sous-traitants, et la valeur principale se déplacer vers les acteurs du design et de l’encapsulation (TSMC) ainsi que vers les clients finaux qui ont le pouvoir de définiter les spécifications (NVIDIA). Les marges des fabricants de mémoire pourraient être compressées.
3 **Changement dans la logique d’investissement**
- Auparavant : L’achat d’actions de mémoire reposait sur les cycles de prix (augmentation/ baisse).
- Aujourd’hui : L’achat d’actions de mémoire dépend de les barrières technologiques (qui a le meilleur processus de mise en pile ? Qui est le plus étroitement lié à NVIDIA ?) et de la collaboration avec les fabricants de puces (qui peut obtenir des quotas d’encapsulation de TSMC ?).
- SK Hynix, grâce à sa technologie MR-MUF et à sa forte collaboration avec NVIDIA, est actuellement le principal bénéficiaire.
- Samsung/Micron : ils cherchent à rattraper leur retard, mais font face à des défis liés aux transitions technologiques et aux barrières de brevets.
- TSMC, en tant que fournisseur d’encapsulation et de la base de la puce, occupe une position de force et est un maillon essentiel de la chaîne industrielle de l’HBM.
---
V. Perspectives pour l’avenir de l’HBM
L’article mentionne plusieurs tendances à suivre :
1. Augmentation du nombre de couches de stockage : de 12 à 16 couches, voire plus. Cela augmentera encore la capacité, mais augmentera également les difficultés et les coûts de fabrication.
2. Personnalisation de plus en plus répandue : L’HBM deviendra de plus en plus similaire à des puces plutôt que à des barrettes de mémoire. Différents clients (NVIDIA, AMD, Huawei, etc.) auront des versions personnalisées de l’HBM.
3. Jeu entre coût et performance : Le prix élevé de l’HBM limite la popularité de l’IA. À l’avenir, on cherchera peut-être un équilibre entre l’HBM et la mémoire DDR5 moins chère, ou des améliorations technologiques pour réduire les coûts.
4 Opportunités pour la mémoire flash NAND (disques durs) : Bien que l’article se concentre sur l’HBM, le prix de la mémoire flash NAND a également augmenté. Avec l’explosion des données générées par l’IA, la mémoire flash NAND (comme les SSD d’entreprise) connaîtra également une forte demande.
Conclusion
Au second semestre de 2025, nous assistons non seulement à une augmentation des prix de la mémoire, mais aussi à une réorganisation fondamentale de l’architecture hardware de l’IA.
La puissance de calcul est le moteur, la capacité de stockage est le réservoir et les canalisations qui l’alimentent. Lorsque le moteur devient de plus en plus puissant, si les canalisations ne sont pas suffisamment larges ou rapides, tout le système s’arrête. L’HBM est cette canalisation essentielle et coûteuse.
Pour les investisseurs et les professionnels, il est plus important de comprendre les difficultés technologiques et la répartition des responsabilités dans la chaîne industrielle de l’HBM que de se concentrer simplement sur les fluctuations des prix. Car dans ce jeu, celui qui maîtrise les technologies les plus complexes et les liens les plus solides avec les clients les plus importants (comme NVIDIA) détient le pouvoir futur.
Cette révolution de la capacité de stockage est à peine commencée.