虎嗅

**Chasse à l'intelligence artificielle générale : de multiples modèles mondiaux avancent de concert**

原文:追逐通用人工智能,世界模型多头并进

Résumé des points clés

Cet article se concentre sur les “modèles du monde” dans le domaine de l’IA, soulignant que les grands modèles linguistiques actuels (tels que ChatGPT) présentent des faiblesses critiques dans des tâches telles que la raisonnement physique et la planification spatiale en raison du manque d’expérience du monde réel. Les “modèles du monde”, qui sont capables de simuler les conséquences réelles, sont considérés comme une voie clé vers l’intelligence artificielle générale (IAG). L’article présente également les origines des sciences cognitives de ces modèles, les progrès de leur mise en œuvre commerciale (afflux de capitaux, stratégies des entreprises leaders), les divergences dans les approches technologiques (reconstruction à l’échelle des pixels versus représentation abstraite), ainsi que les nombreux écarts qui subsistent entre ces modèles et l’IAG (abstraction temporelle, métagognition, etc.).

Interprétation détaillée

1. Les faiblesses critiques des grands modèles linguistiques : le manque de “bon sens” du monde réel**

Un exemple simple illustre ce point : lorsque l’on demande à une IA ce qu’il arriverait si une tasse tombait par terre, elle répondra avec des termes techniques tels que “énergie potentielle gravitationnelle” ou “ondes de stress”, tandis qu’un enfant de cinq ou six ans dira simplement “la tasse se brisera”. Pourquoi ? Parce que le cœur des grands modèles linguistiques (LLM) est la prédiction du prochain mot, et ils sont entraînés sur une grande quantité de texte, sans jamais avoir vu réellement une tasse tomber ; sans expérience du monde réel, ils ne peuvent pas vraiment comprendre les lois physiques.

Par exemple, lors de la navigation, un LLM peut mémoriser le itinéraire, mais il sera perdu s’il doit en changer (car il n’a qu’une description écrite et pas la “carte mentale” des humains) ; pour une tâche quotidienne comme plier des vêtements, l’LLM est complètement incompétent : il sait seulement décrire les étapes, mais pas comment les réaliser dans le monde réel. C’est la définition même de leurs limites : ils sont des “experts en texte”, pas en réalité.

2. Les modèles du monde : un système qui permet à l’IA d’imaginer les conséquences comme les humains

L’idée des modèles du monde remonte au psychologue Clark en 1943, qui a suggéré qu’il existe dans le cerveau humain un “petit modèle” capable de simuler les conséquences des actions (par exemple, on ne touche pas intentionnellement une tasse en sachant qu’elle se brisera). La théorie ultérieure du “traitement prédictif” a développé cette idée, affirmant que la perception humaine consiste à prédire constamment le monde et à corriger ces prédictions à l’aide des informations des sens. Les chercheurs en IA veulent donner à l’IA cette capacité : simuler les conséquences avant d’agir pour éviter les erreurs dans la réalité. Comme le lauréat du prix Turing Yang Likun l’a dit : “Une IA sans capacité de prédiction n’est pas vraiment intelligente ; l’intelligence, c’est utiliser des idées pour essayer et échouer à notre place.”

3. L’afflux de capitaux sur les modèles du monde : une nouvelle direction pour l’IA

Ces deux dernières années, les modèles du monde sont devenus un enjeu majeur pour les investisseurs et les géants technologiques :

  • Li Feifei, une experte en IA, a fondé World Labs avec 230 millions de dollars pour travailler sur l’“intelligence spatiale” ;
  • Yang Likun a quitté Meta pour fonder le laboratoire AMI avec 1 milliard de dollars dédié aux modèles du monde ;
  • Le système Dreamer4 de Google DeepMind, après avoir regardé de nombreux enregistrements de “My World”, est capable d’explorer seul des activités complexes (comme collecter des ressources ou fabriquer des outils, ce qui nécessite plusieurs étapes).

Cependant, ces projets sont encore à l’état de prototype : par exemple, Marble de World Labs n’est qu’un générateur d’environnements 3D, et Genie3 est plus proche d’un simulateur de jeu que d’un robot capable de réaliser des tâches ménagères.

4. Les divergences technologiques : reconstruction à l’échelle des pixels versus représentation abstraite

Deux approches principales coexistent et suscitent de vifs débats :

  • Reconstruction à l’échelle des pixels : comme Dreamer4, qui doit reconstituer chaque pixel pour simuler avec précision les conséquences d’une action. L’avantage est la richesse des détails, mais cela nécessite une grande quantité de données ;
  • Représentation abstraite : l’approche de Yang Likun (JEPA) ne reproduit pas les détails, se concentrant uniquement sur les informations essentielles pour le raisonnement (par exemple, on sait qu’une tasse se brisera sans savoir où se trouveront chaque morceau). L’avantage est la réduction des besoins en données, mais la question reste de savoir si ces informations suffisent pour un raisonnement complexe. Par exemple, V-JEPA2 peut apprendre les lois du mouvement des objets, mais il n’a pas encore été prouvé qu’il puisse soutenir des agents intelligents dans des environnements variés.

Chaque approche a ses arguments : Hafner (responsable de Dreamer4) pense que la reconstruction à l’échelle des pixels peut également mener à une représentation abstraite, tandis que Yang Likun estime que l’abstraction est plus efficace.

5. Beaucoup reste à faire avant l’IAG : il manque plus que les modèles du monde

Même si les modèles du monde deviennent plus performants, il y a encore de nombreux obstacles avant d’atteindre l’IAG (une intelligence capable de tout faire comme les humains) :

  • Abstraction temporelle : l’IA ne peut prédire que ce qui se passera dans une seconde, pas les conséquences à long terme ;
  • Métagognition : l’IA ne sait pas ce qu’elle sait ou ne sait pas ; elle répond de manière aléatoire et ne réalise pas ses propres erreurs ;
  • Causalités multiples et compréhension des pensées humaines : les humains peuvent comprendre des causalités complexes (par exemple, “la route est glissante à cause de la pluie”) et deviner ce que les autres pensent (par exemple, “il fronce les sourcils parce qu’il est en colère”), mais l’IA ne peut pas le faire.

Les experts affirment que les modèles du monde sont une condition nécessaire, mais pas suffisante : l’IAG nécessite une combinaison de nombreuses autres capacités.

En conclusion

Les modèles du monde représentent une étape importante dans la progression vers l’IAG, mais ils ne sont pas la solution miracle. Pour que l’IA pense vraiment comme les humains, il reste un long chemin à parcourir.