虎嗅

GPT-6 est arrivé : nous avons discuté avec plusieurs experts du domaine de la protection et des obstacles liés à l’intelligence corporelle.

原文:GPT-6 来了,我们和多个局内人聊具身智能的护城河与暗礁

GPT-6 est là : l’“enceinte” de l’intelligence corporelle existe-t-elle encore ? – Une analyse approfondie sur l’anxiété, les opportunités et les fondamentaux

Bonjour à tous, je suis votre journaliste financier. Récemment, le monde de la technologie a été secoué par la sortie de la version Astra de GPT-6 par OpenAI, qui a également exprimé l’intention de développer des robots humains. C’est un peu comme un géant armé d’une épée de bataille qui déclare soudainement : “Je vais aller cultiver la terre.”

Pour les entreprises innovantes dans le domaine de l’intelligence corporelle, qui travaillent dur sur le hardware et les algorithmes des robots, cela représente non seulement une pression, mais aussi une crise existentielle : si l’IA devient suffisamment intelligente, auront-elles encore besoin de spécialistes en robotique ? Mon emploi sera-t-il menacé ?

Aujourd’hui, nous allons analyser cette situation en prenant en compte les points de vue de plusieurs experts du secteur (comme Zhu Zheng de Jijia Vision, Zhu Xing d’Ant Lingbo, Wang Qian de Zi Bian Liang), pour vous expliquer clairement ce que GPT-6 apporte réellement et où se trouve l’“enceinte” de l’intelligence corporelle. Devrions-nous paniquer ou rester calmes ?

---

I. Le loup est vraiment là : pourquoi tout le monde commence-t-il à s’inquiéter ?

Tout d’abord, il faut admettre que cette anxiété est justifiée et n’est pas sans fondement.

1. La sensation d’une “attaque de dimension réduite”

Auparavant, on pensait que la création de modèles linguistiques (comme ChatGPT) et celle de robots (intelligence corporelle) étaient deux choses différentes. Mais maintenant, GPT-6 Astra peut non seulement converser, mais aussi contrôler directement des bras mécaniques. Dans les vidéos de démonstration, elle saisit des baguettes et insère des verres avec aisance.

Zhu Zheng de Jijia Vision l’a dit très clairement : “Le loup est là, abandonnez les illusions.” Sa logique est la suivante : les modèles linguistiques ont déjà “englouti” les capacités multimodales (voir des images, écouter des sons) et commencent maintenant à envahir le domaine de l’intelligence corporelle. De plus, des géants comme OpenAI dominent complètement les entreprises en termes de talents, de puissance de calcul et de financement. Si ces entreprises décident de s’impliquer directement, il sera très difficile pour les startups de résister.

2. L’urgence du temps

Zhu Zheng estime que les prochaines années sont cruciales. Les entreprises d’intelligence corporelle n’ont pas encore établi d’“enceinte” véritablement difficile à copier par d’autres. Si les géants entrent sur le marché maintenant, ils pourraient rapidement combler les lacunes technologiques et éliminer les startups qui sont encore en train de développer leur première génération de produits.

**3. La nature de l’anxiété : la peur d’une “réalisation prématurée”

L’essence de cette anxiété réside dans le fait que la valeur de l’intelligence corporelle nécessitait plusieurs années de développement et de validation par les entreprises. Mais maintenant, les grandes entreprises de modèles linguistiques pourraient “réaliser” cette valeur prématurément en lançant de nouveaux modèles, s’emparant ainsi des bénéfices.

---

II. Ne vous précipitez pas pour pleurer : l’entrée des grands modèles dans le monde physique n’est pas si simple

Bien que l’anxiété soit réelle, des voix calmes et rationnelles ont également été entendues lors de la conférence. Zhu Xing d’Ant Lingbo et Wang Qian de Zi Bian Liang ont posé une question pertinente : Si OpenAI est si puissant, pourquoi ne pas se concentrer sur l’automatisation et éliminer Tesla ?

1. “Comprendre les principes” ne signifie pas “savoir comment agir”

Les modèles linguistiques sont forts en termes de “sémantique” et de “logique” – par exemple, savoir ce qu’est un “verre” ou la signification de l’instruction “mettre un verre sur la table”. Mais le monde physique est complexe, dynamique et plein de facteurs de friction.

  • Niveau sémantique (cerveau) : savoir où se trouve l’objet et où le placer. GPT-6 est très performant à cet égard.
  • Niveau physique (mains et pieds) : savoir comment appliquer la force, ajuster les angles, gérer les chutes des objets. C’est là que GPT-6 a des lacunes pour l’instant.

2. Le fossé entre les données et la validation

Le progrès des modèles linguistiques repose sur des quantités massives de données de programmation et des systèmes de validation complets. Bien que des avancées aient été réalisées dans la génération de vidéos, cela n’a pas encore résolu les problèmes de contrôle des mouvements des robots.

Les grandes entreprises de modèles doivent encore compléter leur infrastructure :

  • Données réelles : des données sur les chutes des robots dans le monde réel, les échecs des saisies.
  • Adaptation du hardware : différents bras mécaniques, différents capteurs nécessitent des stratégies de contrôle distinctes.
  • Systèmes de validation : comment prouver que le robot agit correctement ? Cela nécessite des systèmes d’évaluation complexes.

3. La distance en termes de capacités industrielles

Zhu Xing a fait un parallèle avec l’automatisation : même si les modèles sont avancés, cela ne suffit pas pour comprendre les scénarios réels ou obtenir des données fiables. Développer des données de qualité est un travail plus difficile.

---

III. Analyser la vérité : que peut vraiment faire GPT-6 ? Et que ne peut-il pas faire ?

Pour comprendre la véritable place de GPT-6 dans l’intelligence corporelle, l’équipe de recherche de Xu Huazhe (RoboDojo) a mené des tests très concrets. Les résultats montrent que GPT-6 n’est ni un “dieu” ni un “inutile”, mais plutôt un **“conseiller puissant”.

1. Points forts : compréhension sémantique et spatiale (“voir” et “penser”

Dans les tests, Astra s’est très bien comportée :

  • Elle a reconnu les objets sur la table.
  • Elle a pu saisir des baguettes fines et même les insérer dans des verres.
  • Elle a pu planifier des actions non liées à la saisie, comme pousser ou déplacer des objets.

Cela montre que GPT-6 est très fort pour déterminer ce qu’il faut faire et comprendre les relations spatiales.

2. Points faibles : interactions complexes et opérations délicates (“faire” et “contrôler”

Lorsque les tâches deviennent plus complexes (par exemple, soulever des objets avec des baguettes, plier des vêtements, passer des objets d’une main à l’autre), les performances d’Astra sont moins bonnes, avec un taux d’échec élevé.

Raison : les interactions physiques comportent de nombreux facteurs invisibles (friction, élasticité des objets, changements infimes du centre de gravité) qui ne peuvent pas être déterminés uniquement à partir de l’apparence (vue) et nécessitent des ajustements en temps réel basés sur des feedbacks tactiles.

3. L’architecture hybride est la clé

Les recherches de RoboDojo ont révélé que :

  • Contrôle direct par GPT-6 Astra : taux d’échec de 26 %.
  • Contrôle hybride avec GPT-6 Astra et un modèle corporel spécialisé (π₀.₅) : taux d’échec de 48 %.
  • Détails : dans l’architecture hybride, GPT-6 ne corrige que 14,4 % des mouvements, tandis que 85,6 % sont réalisés par le modèle corporel sous-jacent.

Interprétation :

Cela prouve que la combinaison de résolution générale + expérience locale est la meilleure approche actuelle. GPT-6 est responsable de la planification globale (par exemple, “prendre d’abord le verre, puis la cuillère”), tandis que le modèle sous-jacent s’occupe des détails de l’exécution.

Conclusion :

GPT-6 n’a pas “résolu” les problèmes de l’intelligence corporelle, mais il a considérablement amélioré les capacités du système. Il est comme un commandant expérimenté, mais les modèles de contrôle sous-jacents restent indispensables.

---

IV. Où se trouve l’“enceinte” ? Une redéfinition de la notion de “données” à “système fermé”

Puisque GPT-6 est si puissant, où se trouve réellement l’“enceinte” des entreprises d’intelligence corporelle ? Avant, on disait “j’ai des données” ; maintenant, cette affirmation doit être remise en question.

1. Le “barrage des données” s’estompe

Li Tianyu de Yuan Ce Future a partagé une tendance : ils commencent déjà à utiliser GPT-6 pour générer des scénarios simulés.

  • Auparavant : créer des scénarios 3D nécessitait beaucoup de travail manuel, coûtant cher et prenant du temps.
  • Maintenant : GPT-6 peut générer rapidement des scénarios 3D logiques et complets grâce à la programmation.

Cela signifie que “disposer de données” n’est plus un avantage, car le coût de production des données diminue. L’avantage précédemment basé sur l’accumulation de données est érodé par les capacités des modèles généraux.

2. Le véritable barrage : la capacité à découvrir continuellement des problèmes

Si les données sont facilement accessibles, qu’est-ce qui est difficile à obtenir ?

  • Connaître dans quels cas les robots échouent.
  • Entrer dans ces scénarios pour collecter des données d’échec.
  • Identifier les informations réellement manquantes à partir de ces échecs.
  • Confirmer les améliorations grâce à l’entraînement et à l’évaluation.

C’est là le véritable enjeu. Les grandes entreprises de modèles peuvent être bonnes pour “produire des données en masse”, mais les entreprises d’intelligence corporelle sont expertes pour se tromper dans le monde réel.

L’“enceinte” n’est plus “combien de données j’ai”, mais “j’ai un système fermé capable d’apprendre constamment à partir des échecs et de transformer ces données en produits fiables”.

3. Origine physique vs. ajustement sémantique

Shen Yujun d’Ant Lingbo et Min Wei de Ying Shen Zhi Intelligence ont souligné l’importance de l’“origine physique” :

  • Ancien chemin : ajuster des modèles linguistiques (VLM) ou des modèles vidéo pour obtenir des modèles corporels.
  • Risque : si les modèles de base (comme GPT-6) évoluent rapidement, vos modèles ajustés deviennent obsolètes.
  • Nouveau chemin : développer des modèles basés sur les lois physiques et les changements spatiaux (comme des modèles 4D).

Parabole : l’ancien chemin est comme construire une maison sur le sable ; l’eau (le modèle de base) monte et tout disparaît. Le nouveau chemin est comme construire une maison sur des rochers ; c’est plus difficile, mais plus stable.

---

V. Le futur du secteur : pas de “qui mange qui”, mais de “symbiose et division du travail”

Enfin, il faut sortir de la pensée du “jeu à somme nulle”. L’apparition de GPT-6 ne signifie pas la fin de l’industrie de l’intelligence corporelle, mais plutôt une réorganisation de la division du travail.

1. Infrastructure vs. livraison d’applications

Min Wei de Ying Shen Zhi Intelligence pense que OpenAI pourrait devenir un fournisseur d’infrastructure, comme les réseaux d’eau et d’électricité :

  • OpenAI/Anthropic : fournir des capacités cognitives générales (le “cerveau”) en tant qu’API de base ou modèle de base.
  • Entreprises d’intelligence corporelle : s’occuper de l’intégration du hardware, de l’adaptation aux scénarios, de l’optimisation des interactions physiques et des services après-vente.

Logique commerciale : dans un produit robotique final, les capacités linguistiques des grands modèles ne représenteront peut-être que la moitié de la valeur ; le reste proviendra de la compréhension des lois physiques, de l’ingénierie mécanique et des interactions complexes avec l’environnement. Ces tâches sont difficiles et les géants ne sont peut-être pas prêts à les assumer entièrement, ni peuvent-ils les externaliser complètement.

2. Un renforcement mutuel : les robots rendent l’IA plus intelligente

Shen Yujun a proposé une perspective inverse : l’intelligence corporelle pourrait à son tour influencer les grands modèles.

Les robots, grâce à leurs capteurs, fournissent des données précieuses sur l’environnement que les modèles numériques ne possèdent pas.

  • Les données sur les chutes des robots peuvent aider l’IA à comprendre la gravité.
  • Les échecs des saisies peuvent aider l’IA à comprendre la friction.

Conclusion : le monde physique offre de nouvelles voies d’évolution pour l’IA. Les entreprises d’intelligence corporelle ne sont pas seulement des utilisatrices de l’IA, mais aussi des fournisseurs de “nourriture” pour son évolution.

3. Changement des critères de compétition

La compétition future ne sera pas basée sur “qui a les plus grands paramètres de modèle”, mais sur :

  • Qui peut atteindre un taux de réussite plus élevé avec moins d’expérience d’interaction ?
  • Qui a des coûts de déploiement plus bas ?
  • Qui peut mieux gérer les anomalies sur site et contrôler les coûts d’entretien ?
  • Qui peut créer un cycle rapide de déploiement, feedback et amélioration ?

---

Conclusion : Conseils pour le grand public et les professionnels

1. Pour les investisseurs : Ne poursuivez pas aveuglément les concepts d’intelligence corporelle basés uniquement sur des logiciels, et ne rejetez pas complètement les entreprises de hardware à cause de GPT-6. Concentrez-vous sur celles qui disposent de données réelles pour des scénarios concrets, de capacités de développement de modèles physiques originaux et de contrôle des coûts de déploiement.

2. Pour les entrepreneurs :

  • Ne pensez pas pouvoir survivre en “ajustant” simplement les grands modèles ; c’est une impasse.
  • Fondez-vous sur le niveau physique : concentrez-vous sur l’intégration des capteurs, l’optimisation de la structure mécanique, la collecte de données réelles et l’analyse des échecs.

Utilisez des outils : profitez de GPT-6 et d’autres outils pour réduire les coûts de simulation et de nettoyage des données, et investissez les ressources ainsi économisées dans la recherche sur les interactions physiques.

Créez des systèmes fermés : votre “enceinte” ne réside pas dans les données elles-mêmes, mais dans votre capacité à extraire des “intuitions physiques” à partir de ces données.

3. Pour le grand public :

GPT-6 ne fera pas disparaître les robots du jour au lendemain, mais il les rendra plus intelligents et moins chers. Dans les prochaines années, nous verrons plus de robots “semi-automatiques” dans les usines et les foyers. Ils commettent peut-être encore des erreurs, mais ils deviendront de plus en plus fiables.

En résumé :

GPT-6 est un “accélérateur” pour l’intelligence corporelle, pas un “détructeur”. Il accélère le temps nécessaire pour prouver la valeur des innovations, mais il élevé également les barrières. Les frontières bougent constamment, mais celui qui parviendra à transformer la complexité du monde physique en une force concurrentielle unique pourra conserver sa position.