虎嗅

**Présentation sommaire des grands modèles chinois 01 : Les modèles deviennent de plus en plus complexes, mais personne ne sait vraiment ce qu’ils devraient devenir**

原文:中国大模型简史01:模型越做越大,却没人知道它该变成什么

Résumé du contenu principal

Ceci est le début de l’analyse « Histoire sommaire des grands modèles en Chine », qui retrace les deux années chaotiques de l’industrie des grands modèles en Chine, de l’été 2021 à la fin de 2022, avant le lancement de ChatGPT : à cette époque, il n’y avait aucun cas de succès concret, et personne ne savait à quoi pourraient finalement ressembler ces grands modèles. Les instituts de recherche, les grandes entreprises et les premiers entrepreneurs tâtonnaient dans l’obscurité. Certains ont créé des modèles dépassant de 10 fois la taille de GPT-3 en termes de paramètres, mais ne savaient pas comment les mettre en œuvre ; d’autres, disposant de financements, n’avaient même pas encore défini le premier produit à développer. Ce n’est qu’à la fin de 2022 que deux événements ont complètement orienté le développement de l’industrie vers la compétition nationale des grands modèles que nous connaissons aujourd’hui : les États-Unis ont imposé des restrictions sur l’exportation de puces AI de haute technologie, et ChatGPT est devenu accessible gratuitement au public.

---

Interprétation simplifiée point par point

1. Les grands modèles de 2021 n’étaient pas conçus pour les utilisateurs ordinaires

Aujourd’hui, l’image des grands modèles est celle de robots de conversation, mais ceux créés en Chine en 2021 n’avaient rien à voir avec la conversation. Par exemple, le modèle Wudao 2.0, avec 1,75 trillion de paramètres, soit 10 fois plus que GPT-3, intégrait des fonctionnalités de reconnaissance multimodale et de prédiction de protéines, sans aucune fonction de conversation destinée au grand public.

L’imagination des professionnels de l’époque était très ambitieuse : certains considéraient les grands modèles comme des centrales électriques produisant de l’intelligence à partir de données, alimentant tous les produits AI ; d’autres les voyaient comme des lignes de production industrielles, évitant ainsi à chaque entreprise de devoir réinitialiser les données et entraîner les modèles à partir de zéro. Personne n’aurait pu imaginer que ces modèles deviendraient des fenêtres de conversation utilisées par tout le monde pour discuter – c’était comme si une équipe avait construit une immense centrale électrique destinée aux usines, mais que les gens l’avaient finalement utilisée pour réchauffer leur nourriture, ce qui dépassait complètement toutes les attentes.

2. La course aux paramètres au début n’était pas destinée à attirer des investissements

Beaucoup ont critiqué par la suite la course aux paramètres comme étant inutile et basée sur le bluff. En réalité, les chercheurs découvraient de nouvelles lois fondamentales : auparavant, l’IA était spécialisée dans des domaines précis (traduction, analyse émotionnelle, etc.), et un chercheur pouvait travailler toute sa vie dans un seul domaine. Mais avec l’apparition de GPT-3 en 2020, il s’est avéré que plus un modèle était grand et plus il pouvait effectuer plusieurs tâches simultanément (traduction, rédaction de textes, résolution de problèmes mathématiques) sans nécessiter d’entraînement séparé. Une « loi de l’échelle » a été confirmée : en augmentant les paramètres, les données et les ressources de calcul, les capacités du modèle s’amélioraient de manière constante, sans plafond visible. Auparavant, quelques cartes graphiques suffisaient pour la recherche en IA ; aujourd’hui, des centaines de cartes sont nécessaires, comme si pour jouer à un jeu, il fallait rassembler un équipement de haute performance au lieu de quelques équipements basiques.

3. Les acteurs de différents milieux avaient des interprétations très différentes des grands modèles

En 2021, il n’existait pas de consensus parmi les premiers acteurs de l’industrie des grands modèles. Les instituts de recherche comme Zhiyuan, soutenus par Tsinghua, Peking University, Baidu et ByteDance, considéraient les grands modèles comme des infrastructures publiques destinées à être utilisées par tous les secteurs d’activité. Huawei, habituée à fournir des solutions AI aux entreprises, voyait les grands modèles comme des outils pour simplifier le travail de développement. Baidu, avec un graphe des connaissances de 5 milliards d’entités, pensait que les grands modèles devaient intégrer les connaissances humaines de manière significative. Lors d’une discussion, personne ne reconnaissait l’approche des autres, car personne n’avait encore vu de modèle réellement efficace.

4. L’ampleur des premiers projets entrepreneuriaux était surprenante

Ceux qui ont investi dans les grands modèles à la fin de 2021 étaient considérés comme des fous par beaucoup. Par exemple, Yan Junjie, qui a développé MiniMax, ne connaissait même pas de produit de conversation basé sur des grands modèles existants à l’époque ; les investisseurs ont investi parce qu’ils sentaient que son idée, bien qu’incompréhensible, représentait l’avenir. Lorsqu’ils ont finalement créé un modèle avec 30 milliards de paramètres, ils se sont rendu compte que celui-ci ne pouvait pas servir d’assistant de bureau fiable et ont donc développé Glow, un produit de conversation virtuelle. À l’époque, créer un grand modèle ne signifiait pas disposer d’un plan commercial clair ; il s’agissait plutôt de créer le modèle et de voir à quoi il pouvait être utilisé.

5. Deux événements à la fin de 2022 ont définitivement changé les règles du jeu

Avant octobre 2022, l’industrie des grands modèles en Chine avait un but clair : augmenter la puissance de calcul et développer de nouveaux applications. Mais deux événements ont bouleversé la situation : les restrictions sur l’exportation de puces AI, et le lancement gratuit de ChatGPT. Les entreprises qui cherchaient à développer des centrales électriques ou des lignes de production industrielles ont soudain réalisé que l’interface utilisateur la plus intuitive pour les grands modèles était la conversation. Toutes les divergences de vues ont été résolues, et l’industrie est entrée dans une phase de compétition nationale.

---

Cette traduction respecte les exigences spécifiées, y compris la structure Markdown, le langage naturel et adapté au contexte financier, ainsi que la précision de la terminologie.