第一财经

Les données d'intelligence corporelle connaissent une croissance exponentielle, mais la validation complète des modèles n'a pas encore été réalisée.

原文:具身智能数据“狂飙”,但还未完全实现模型验证

---

Résumé du contenu principal de l’article

Ce rapport souligne le tournant majeur actuel dans l’industrie des robots humanoïdes : jusqu’à présent, l’ensemble de l’industrie était bloqué par un problème majeur, à savoir un manque critique de données d’entraînement. Désormais, un certain nombre d’entreprises chinoises ont pris l’initiative de mettre en place des “usines de collecte de données” pour la production industrielle de ces données, atteignant des capacités de production annuelles de plusieurs centaines de milliers d’heures, voire un million d’heures, ce qui résout le problème initial de la difficulté à collecter des données de qualité. Cependant, l’industrie a rapidement découvert que les données collectées dans des scénarios simulés créés manuellement ont des limites. Pour créer des robots humanoïdes capables de travailler réellement, il est nécessaire de suivre un cycle positif : d’abord entraîner le robot à un niveau de 70 % de compétence, de l’envoyer dans un environnement réel pour qu’il exerce ses fonctions, et en même temps collecter des données réelles pour améliorer le modèle. L’industrie se trouve donc à un carrefour crucial, passant de la simple accumulation de données à la mise en œuvre efficace de ces données.

---

Interprétation simplifiée des points clés

1. Pourquoi l’industrie se précipite-t-elle pour collecter des données ? La raison en est que les “manuels de référence” nécessaires à l’entraînement des robots étaient auparavant complètement indisponibles.

Les grands modèles d’IA que nous utilisons actuellement s’apprennent à partir des contenus textuels et vidéo disponibles sur Internet, ce qui équivaut à parcourir tout le savoir accumulé par l’humanité au cours des millénaires. Or, les robots humanoïdes doivent apprendre à “travailler dans le monde réel” : par exemple, comment porter une tasse sans la faire tomber, comment éviter les objets autour d’une table, ou comment traverser des fils électriques au sol. Il n’existe pas suffisamment de données précises et annotées sur Internet pour enseigner ces actions détaillées.

À quel point le manque de données était-il problématique ? De nombreux robots ne parvenaient même pas à effectuer des actions de base telles que “ouvrir une porte” : il y avait trop peu d’exemples pour des poignées de porte de différentes formes, des portes de poids variés, ou des obstacles derrière elles. La collecte intensive de données vise donc à créer une base de connaissances solide pour que les robots puissent acquérir les compétences nécessaires.

2. L’industrie a créé des “écoles de conduite spécialisées pour robots”, et le modèle de production industrielle de données a été mis en place.

Auparavant, la collecte de données d’entraînement pour les robots était très inefficace : soit les robots enregistraient des mouvements aléatoires inutiles, soit des personnes étaient engagées pour filmer des vidéos, mais les détails des mouvements étaient souvent inexacts. Les entreprises leaders ont maintenant établi des centres de collecte de données spécialisés, créant des environnements réalistes tels que des cuisines, des rayons de supermarchés ou des lignes de production, où des opérateurs contrôlent les robots pour effectuer diverses tâches (nettoyer des plaques de cuisson, ranger des produits, trier des courriers). Chaque action est enregistrée avec précision, et des systèmes d’analyse automatique éliminent les données inutiles 24 heures sur 24. Ces données sont traitées en cloud et livrées aux équipes d’entraînement dès le lendemain.

Ce modèle est maintenant entièrement industrialisé, et les meilleurs centres de collecte peuvent produire plusieurs centaines de milliers d’heures de données de haute qualité par an. Certaines entreprises ont même collecté un million d’heures de données utiles, ce qui équivaut à fournir aux robots une “expérience d’entraînement de plusieurs années”. Le problème majeur de la collecte de données a ainsi été largement résolu.

3. Les robots formés dans ces “écoles de conduite” présentent des limites.

Bien que le modèle de collecte de données soit rapide, les robots ainsi formés ne sont que des débutants parfaitement qualifiés, mais ils ont des défauts inhérents. Premièrement, les scénarios simulés sont souvent artificiels : les objets dans les écoles de conduite sont toujours bien disposés, contrairement aux situations réelles qui peuvent être imprévisibles (des bouteilles de sauce soja sur les plaques de cuisson, des sols glissants, etc.). Deuxièmement, les normes de collecte de données varient d’une entreprise à l’autre, ce qui peut entraîner des erreurs dans l’apprentissage des robots. Enfin, les mouvements lents effectués dans les centres de collecte ne correspondent pas à la vitesse réelle du travail dans les usines ou les restaurants.

4. La solution réside dans un cycle positif : faire travailler les robots avant de les améliorer.

La meilleure approche consiste à faire travailler les robots dans un environnement réel pour collecter des données utiles. Cela permet aux robots d’améliorer rapidement leurs compétences. Le rapport mentionne qu’un robot initialement peu fiable devient beaucoup plus performant après avoir collecté des données. Une fois ce cycle mis en place, il devient beaucoup plus facile d’adapter les robots à de nouveaux environnements.

5. Les “millions d’heures de données” collectées ne sont qu’un premier pas : la victoire n’est pas encore décidée.

Bien que les entreprises affichent fièrement les quantités de données qu’elles ont collectées, aucune ne peut garantir la création de robots parfaitement fonctionnels. L’industrie est encore en phase d’expérimentation pour déterminer le nombre d’heures de données nécessaires pour obtenir des modèles efficaces. Les prochaines années verront de nombreux robots être utilisés dans des environnements réels (centres de livraison, restaurants, usines), et ces scénarios seront les véritables tests de l’efficacité des robots humanoïdes.

---

Cette traduction respecte les exigences spécifiées, y compris la structure du texte original, l’utilisation d’un langage naturel et adapté au journalisme financier, ainsi que la précision de la terminologie.