虎嗅

Le monde n’est plus préfabriqué : quelle direction prendra la prochaine génération de modèles ?

原文:世界不再预制,下一代模型往哪走?

Résumé du contenu principal

Il s’agit d’une table ronde industrielle à laquelle ont participé de jeunes chercheurs de premier plan dans le domaine de l’IA de plusieurs universités hongkongaises. L’ensemble de la discussion n’a pas porté sur des concepts abstraits ou des promesses exagérées, mais plutôt sur les problèmes concrets liés à l’application des « modèles mondiaux », qui sont actuellement très en vogue mais dont la définition est extrêmement floue. Les chercheurs ont corrigé une idée répandue selon laquelle « l’IA capable de générer des vidéos serait un modèle mondial », ont démenti l’illusion que « l’analyse de toutes les vidéos disponibles sur Internet pourrait permettre de créer des robots universels » ou que « une version robotique de ChatGPT apparaîtrait bientôt », et ont même remis en question l’affirmation selon laquelle « un volume d’entraînement de un million d’heures serait un indicateur fiable ». Le consensus atteint par les chercheurs est que la voie technologique des modèles mondiaux n’est pas encore définie et que ce n’est pas uniquement le monopole des grandes entreprises ; les petites équipes et les entrepreneurs ont encore de nombreuses opportunités de se distinguer en se concentrant sur des scénarios spécifiques.

---

Interprétation simplifiée des points clés

1. 99 % des soi-disant « modèles mondiaux » sur le marché ne sont que des approximations

Beaucoup pensent que l’IA capable de générer des vidéos cohérentes, comme celle d’un chat renversant une tasse d’eau, constitue un modèle mondial. Or, il s’agit de deux choses différentes : les systèmes d’IA de génération de vidéos se contentent de mettre les pixels en ordre pour correspondre à notre perception visuelle ; ils ne comprennent pas que la tasse peut se briser au sol, que l’eau peut se répandre, ou même que la tasse peut être cachée par un coin de table. Un véritable modèle mondial devrait être capable de comprendre les lois du monde réel. Par exemple, s’il vous demande de pousser une tasse, il devrait pouvoir prédire à quel point elle glissera et combien d’eau sera versée, même si elle est cachée. Les équipes travaillant sur la génération de vidéos, la conduite autonome ou la création de robots utilisent tous le terme de « modèle mondial », mais elles suivent des approches complètement différentes et sont loin d’atteindre un niveau de convergence.

2. Espérer créer des robots universels en analysant toutes les vidéos sur Internet ? C’est loin d’être réaliste

Beaucoup imaginaient que ChatGPT, en analysant toutes les données textuelles sur Internet, deviendrait un modèle universel. Mais cette idée est irréaliste : les vidéos sur Internet montrent principalement des scénarios réussis (des personnes tenant fermement une tasse, coupant des légumes sans encombre). Or, les robots ont besoin de connaître les échecs et les situations problématiques, qui ne sont pas présents dans ces vidéos. De plus, la flexibilité humaine et les mouvements ne sont pas comparables à ceux des bras mécaniques ou des robots. Les vidéos Internet ne peuvent servir qu’à éclairer les robots, mais pas à remplacer les données réelles obtenues à travers des expériences pratiques.

3. Arrêtez de parler de l’« ère du ChatGPT doté d’intelligence corporelle » : nous n’avons même pas encore atteint le niveau de base

De nombreuses entreprises de robots annoncent des démonstrations (ouvrir une porte, verser de l’eau) et proclament l’arrivée d’une telle ère. Cependant, ces démonstrations ne sont rien de plus que des astuces marketing. La véritable capacité de ChatGPT est de fournir des réponses fiables face à des problèmes inédits. Les robots, quant à eux, suivent des procédures préétablies (comme ouvrir une porte) et ne peuvent pas s’adapter spontanément à de nouvelles situations. Ils doivent d’abord prouver leur efficacité dans des environnements contrôlés (usines) avant de pouvoir être utilisés dans des contextes domestiques.

4. Le chiffre de « un million d’heures d’entraînement » est largement exagéré

De nombreuses entreprises vantent des volumes d’entraînement importants pour leurs robots. Mais cela ne reflète pas réellement leur capacité d’apprentissage. Par exemple, un robot de nettoyage qui tourne constamment dans le même salon ne récolte aucune information utile ; en revanche, un instant où il renverse une tasse et essaie de la redresser peut être beaucoup plus instructif. Les données utilisées pour les modèles linguistiques étaient basées sur des mots uniques, tandis que pour les robots, les mouvements répétitifs ne sont pas significatifs. L’unité de mesure efficace de l’apprentissage devrait être le nombre de changements de mouvements importants, et non le temps d’entraînement.

5. Les futurs robots n’auront pas besoin de configurations personnalisées pour chaque corps

Les robots actuels ont souvent des limitations : un changement de taille ou de forme des composants nécessite un réentraînement complet, ce qui est coûteux. Les humains, en revanche, peuvent s’adapter facilement avec des équipements différents. Un modèle mondial efficace devrait être capable de s’adapter à diverses configurations corporelles et de comprendre automatiquement ses capacités, sans nécessiter de réentraînement pour chaque nouveau modèle.