Résumé des points clés
Le secteur de l’intelligence corporelle (robots AI capables d’interagir avec le monde physique) est en plein essor, mais il existe une erreur répandue dans l’industrie concernant l’idée que “un million d’heures de données suffiraient pour atteindre un niveau comparable à celui du modèle GPT” : l’efficacité des données (densité d’informations, couverture des cas difficiles, portabilité) est plus importante que la quantité. L’industrie évolue actuellement vers une approche axée sur l’efficacité, en privilégiant les applications industrielles et commerciales (les robots à roues sont plus pratiques que les robots anthropomorphes). Pour le moment, il n’est pas nécessaire de choisir entre les différentes approches de modélisation (VLA ou modèles du monde réel) sur le court terme. Le véritable atout des entreprises de données réside dans leur capacité à mettre en place un cycle complet allant de la collecte aux résultats des essais, y compris les échecs, et non simplement dans la quantité de données accumulées. Il n’y a pas de différence significative entre la Chine et les États-Unis ; la Chine dispose d’avantages en matière de chaînes d’approvisionnement et de matériel.
Analyse détaillée
1. Un million d’heures, juste un slogan ? Les données efficaces sont ce qui compte vraiment
Beaucoup prétendent que l’intelligence corporelle nécessite “un million d’heures de données”, mais Peng Pai de Coolwise a donné un exemple contraire à la logique commune : une simple course de 100 kilomètres sur une route ordinaire ne permet pas au modèle d’apprendre grand-chose, tandis qu’un sac en plastique flottant dans un marché peut révéler les différences dans la capacité des systèmes de radar laser et visuel à détecter les obstacles flexibles – c’est l’importance de la qualité des données.
Critères clés pour évaluer l’efficacité des données :
- La source des données doit être fiable ; de nombreux exemples prétendant représenter “un million d’heures” sont en fait calculés à partir du nombre de tokens des modèles linguistiques, et ils ne peuvent ni être vérifiés ni infirmés ;
- Les données efficaces doivent répondre à trois critères : ① elles doivent être explicables (les échecs doivent pouvoir être attribués à des facteurs précis tels que l’angle d’attaque, la force appliquée ou la stratégie utilisée) ; ② elles doivent contenir un nombre suffisant de cas difficiles (comme les tempêtes ou la circulation mixte entre piétons et véhicules) ; ③ elles doivent être réutilisables sur différents types de robots, ce qui évite des coûts supplémentaires.
Le moment où il faut cesser d’accumuler des données inutiles : lorsque la valeur commerciale des nouvelles données est inférieure aux coûts de collecte (c’est-à-dire lorsqu’on atteint un point de basculement économique). Par exemple, si les données permettent d’obtenir un taux de réussite de 99 % dans une application, il n’est plus avantageux d’en collecter davantage.
2. La pyramide des données a changé : des vidéos humaines en base, des cas difficiles réels en sommet
La “recette” pour entraîner les robots intelligents n’est pas fixe ; une pyramide dynamique s’est développée :
- Base : des vidéos tournées par des humains (par exemple, des vidéos de cuisson ou de nettoyage en ligne) – ces données sont abondantes et permettent un bon apprentissage sur différents types de robots ;
- Milieu : des données simulées ou synthétisées – utilisées pour simuler des scénarios extrêmes (comme des pannes dans des centrales nucléaires) et compléter les exemples difficiles à recueillir dans la réalité ;
- Sommet : des cas difficiles rencontrés en situation réelle – ces données ont la plus grande valeur, car elles améliorent directement la stabilité des modèles.
Logique fondamentale : les trois niveaux de données doivent être utilisés de manière cyclique (par exemple, en utilisant des simulations pour reproduire un problème rencontré par un robot réel, puis en complétant avec des vidéos humaines). Guo Junliang de Qianxun Intelligence a souligné que les vidéos humaines manquent souvent de détails sur l’interaction avec le robot ; les dispositifs UMI (capables de collecter des données via des pinces) sont plus proches de la réalité des mouvements des robots, donc ces données sont également intégrées dans la pyramide.
3. Approches de modélisation : VLA ou modèles du monde réel ? Pas besoin de choisir pour le moment
L’industrie est divisée en deux écoles : celle qui utilise directement les vidéos pour apprendre aux robots (VLA) et celle qui commence par comprendre les lois physiques avant de prendre des décisions (modèles du monde réel). Les experts estiment que lorsque la quantité de données est suffisante, les résultats des deux approches sont similaires. De plus, un système hiérarchisé est plus pratique ; Google Gemini Robotics en est un exemple : un modèle de haut niveau gère la compréhension de la tâche (comme le nettoyage), tandis qu’un modèle VLA de bas niveau s’occupe de l’exécution des actions (comme le mouvement du balai). Dans les scénarios commerciaux, il n’est pas nécessaire d’avoir un seul et même modèle.
4. Commercialisation : commencer par les applications intermédiaires, les robots anthropomorphes ne sont pas indispensables
La génération précédente d’automates visait à “adapter l’environnement aux machines” (par exemple, des robots de nettoyage dans des centres commerciaux fermés) ; aujourd’hui, l’intelligence corporelle vise à “faire en sorte que les machines s’adaptent à la société humaine” (par exemple, des robots de nettoyage sur les trottoirs publics).
Priorités pour le déploiement commercial :
- Éviter les scénarios extrêmes (comme les environnements industriels hautement personnalisés, où l’automatisation est déjà mature et peu rentable) ;
- Les scénarios domestiques sont complexes (présence de personnes âgées, d’enfants ou d’animaux, rendant le marché difficile à développer rapidement) ;
Les applications industrielles et commerciales sont plus prometteuses : par exemple, le transport de marchandises dans les usines ou le nettoyage des centres commerciaux – ces applications nécessitent une certaine personnalisation mais permettent une généralisation des fonctionnalités, avec peu d’interactions humaines avec les robots.
Les robots anthropomorphes ne sont pas un impératif : Guo Junliang de Qianxun Intelligence souligne que des chassis à roues combinés à des mécanismes de levage peuvent couvrir plus de 95 % des tâches actuelles ; les clients se concentrent sur la stabilité du robot, le coût d’entretien et le retour sur investissement, plutôt que sur l’apparence du robot.
5. Comment survivre pour les entreprises de données ? La qualité des données est plus importante que la quantité
Le véritable atout des entreprises de données n’est pas leur capacité à collecter beaucoup de données, mais leur capacité à obtenir des informations utiles à partir des échecs :
- Un cycle complet (collecte → sélection → entraînement → déploiement → analyse des résultats → nouvel entraînement) est essentiel pour améliorer constamment les modèles ; par exemple, si un robot se bloque dans une situation difficile (comme lorsqu’il est coincé par un sac en plastique), l’entreprise de données doit enregistrer cet échec afin que le modèle puisse éviter la même erreur à l’avenir.
Les données doivent être flexibles : elles doivent pouvoir être utilisées sur différents types de robots, sans dépendre d’un modèle spécifique (par exemple, des données provenant de scénarios répétitifs ne sont pas très utiles, tandis que les cas difficiles sont très précieux).
Collaboration avec les équipes de modélisation : les entreprises de données doivent connaître les besoins des équipes de développement et fournir des données pertinentes (par exemple, des données sur des scénarios courants ne sont pas utiles, tandis que les cas difficiles sont très précieux).
Conclusion
La compétition dans le domaine de l’intelligence corporelle se déplace désormais du nombre de données vers l’efficacité. Un million d’heures n’est qu’un point de départ ; le véritable enjeu est de transformer les échecs coûteux de la réalité en expériences qui aident les modèles à éviter des erreurs à l’avenir. Pour les utilisateurs finaux, les robots du futur ne seront peut-être pas nécessairement anthropomorphes, mais ils seront plus intelligents et capables d’interagir efficacement avec notre environnement (par exemple, en évitant les sacs en plastique dans les marchés ou les véhicules de livraison sur les trottoirs), s’intégrant ainsi pleinement à notre quotidien.