Tencent, Alibaba, ByteDance : tous créent-ils des “mondes” pour l’IA ? Derrière cela se cache un enjeu vital pour la seconde moitié du développement de l’IA
Bonjour à tous, je suis votre journaliste financier. Aujourd’hui, nous allons parler d’un sujet qui peut sembler un peu science-fiction, mais qui est en réalité en train de changer profondément la structure du secteur technologique : Pourquoi Tencent, Alibaba, ByteDance, ainsi que des acteurs internationaux comme OpenAI et Anthropic, investissent-ils tant d’efforts dans la création de “mondes” pour les agents intelligents (AI Agents) ?
Si vous suivez l’actualité de l’IA, vous avez sûrement remarqué que les grands modèles se font concurrence pour être les plus intelligents ou les plus rapides à répondre aux questions. Mais cette fois, les géants se battent pour quelque chose de plus fondamental et de plus essentiel : l’environnement dans lequel ces agents intelligents évoluent.
Pour que vous compreniez mieux, je vais résumer l’essentiel de cet article approfondi publié par “Jiazi Guangnian”, puis l’analyser sous cinq angles pour vous expliquer la logique et les opportunités qui en découlent.
📝 Résumé de l’essentiel
En bref, le développement de l’IA est entré dans une seconde phase. La première phase se concentrait sur la capacité à résoudre des problèmes (comme écrire du code ou des articles), tandis que la seconde phase vise la capacité à définir les problèmes et à fonctionner dans des situations réelles complexes.
Pour que l’IA puisse exécuter des tâches complexes comme corriger des erreurs, réserver des billets d’avion ou gérer des bases de données, il ne suffit pas de lui fournir simplement des données textuelles statiques. Elle a besoin d’un environnement dans lequel elle puisse interagir, essayer différentes solutions et recevoir des retours réels.
Actuellement, Tencent Hunyuan, Alibaba Tongyi, ByteDance, ainsi que des entreprises internationales comme OpenAI et Anthropic, investissent des ressources considérables dans la création de ces “mondes virtuels”. Il s’agit non seulement d’une compétition technologique, mais aussi de la naissance d’un nouveau marché d’infrastructure : celui qui pourra fournir des environnements d’entraînement pour l’IA de haute qualité, à grande échelle et évolutifs deviendra probablement le prochain acteur majeur dans ce domaine (le “Scale AI”).
---
🔍 Analyse approfondie : Comprendre la création de ces “mondes” à travers cinq dimensions
1. Pourquoi créer des “mondes” soudainement ? Parce que l’IA doit commencer à “travailler”
Auparavant, lorsque nous parlions à l’IA, elle agissait comme un dictionnaire : on lui posait une question et elle répondait, sans avoir besoin de “faire quoi que ce soit”. Mais maintenant, nous voulons que l’IA puisse exécuter des tâches concrètes.
Imaginez qu’on demande à un stagiaire de diagnostiquer un problème logiciel : on ne peut pas lui donner seulement un manuel de dépannage (des données statiques) ; il a besoin d’un ordinateur, d’un répertoire de code et d’un environnement de fonctionnement pour pouvoir tester des solutions, corriger des erreurs et relancer le programme. Pendant ce processus, il doit voir les changements apportés par ses actions.
C’est exactement ce dont ont besoin les agents intelligents. Yao Shunyu, le chef scientifique en IA chez Tencent, l’explique clairement : “Sans un bon environnement, les agents intelligents ne peuvent pas accomplir diverses tâches”.
Au cours des six derniers mois, l’équipe de Tencent Hunyuan a publié six articles sur ce sujet. Ils ont découvert que les données d’entraînement précédentes étaient des documents statiques, tandis que celles actuelles doivent être des processus interactifs. L’IA doit non seulement savoir comment écrire du code, mais aussi comprendre les modifications apportées aux bases de données et la nature des erreurs qui surviennent lors de son exécution.
En d’autres termes : Auparavant, on enseignait à l’IA à “mémoriser des recettes” ; maintenant, on la laisse “préparer des plats” dans une vraie cuisine.
2. Comment Tencent Hunyuan crée-t-il ces “mondes” ? Quatre équipes travaillent ensemble
Tencent Hunyuan a lancé de grands projets, avec au moins quatre équipes travaillant simultanément sur des objectifs précis :
- Première équipe : allonger la durée des tâches (Long-Horizon) :
Les tâches de test précédentes duraient quelques minutes ; elles étaient trop simples. L’équipe a développé “Long-Horizon-Terminal-Bench”, qui allonge la durée des tâches à plusieurs heures. Par exemple, au lieu de simplement demander à l’IA d’écrire “Hello World”, on lui demande de déployer un service back-end complet. De plus, ils ont généré 37 000 de telles tâches automatiquement, à un coût moyen de seulement 5 cents de dollars pièce. Cela montre que la création de ces environnements peut être industrialisée et à faible coût.
- Deuxième équipe : déplacer l’environnement sur les smartphones (Mobile) :
L’équipe de vision de Hunyuan a créé “PhoneWorld”, qui contient 34 applications simulées (comme Tencent Health ou Maps). L’IA doit y réserver des vaccins ou gérer des tâches entre différentes applications, imitant les opérations réelles sur un smartphone.
- Troisième équipe : faire évoluer l’environnement :
C’est l’aspect le plus crucial. Si l’environnement est trop simple, l’IA peut rapidement le maîtriser et ne rien apprendre de nouveau. L’équipe de Hunyuan ne crée plus les environnements à partir de zéro, mais les fait évoluer automatiquement. Par exemple, un environnement qui ne consistait initialement qu’à écrire une page web statique est maintenant conçu pour être déployé, maintenu dynamiquement et gérer des situations concurrentielles. Cela assure que l’IA ait constamment des choses à apprendre.
- Quatrième équipe : intégrer dans les processus d’entraînement (Pipeline) :
Ils ont automatisé les étapes de génération de tâches, de création d’environnements de test et de validation des résultats, les intégrant directement dans les processus d’entraînement de l’IA. Cela permet à l’IA de s’entraîner en temps réel dans ces mondes virtuels, plutôt que d’apprendre après coup.
Notez un détail : Il y a eu des ajustements organisationnels au sein de Tencent : les équipes chargées des grands modèles linguistiques et des modèles multimodaux ont été fusionnées sous la direction de Yao Shunyu, qui a également été chargé de la mise en œuvre des techniques d’apprentissage renforcé pour les agents intelligents. Cela montre que la création de ces environnements est une priorité stratégique au niveau de l’entreprise.
3. Alibaba et ByteDance sont également engagés, et de manière encore plus intensive
Tencent n’est pas le seul : Alibaba et ByteDance ont également commencé à investir dans ce domaine, avec des approches distinctes :
- Alibaba Tongyi :
L’équipe a collaboré avec les universités de Zhejiang et Pékin pour publier un article intitulé “Towards General Agentic Intelligence via Environment Scaling”. Leur idée principale est que plus l’environnement est varié, plus l’IA sera capable de gérer de nombreuses tâches. Ils ont créé plus de 800 000 environnements d’ingénierie logicielle vérifiables, à une échelle impressionnante.
- ByteDance Seed :
L’équipe a développé “Agent-World”, qui contient plus de 2 000 environnements et 19 000 outils. Ces environnements sont générés dynamiquement : si l’IA rencontre des difficultés, le système crée automatiquement des tâches ciblées pour l’aider à s’améliorer. C’est comme un enseignant qui utilise les erreurs des élèves pour concevoir des exercices adaptés.
Point commun : Tous passent d’environnements basés sur des données statiques à des environnements interactifs dynamiques. Et tous cherchent à surmonter un problème majeur : la création d’environnements de haute qualité est très difficile.
4. Le plus grand défi : 99,7 % des environnements créés sont inutilisables… comment y remédier ?
Ce chiffre est particulièrement préoccupant : l’équipe de Tencent Hunyuan a collecté 47 678 environnements publics sur GitHub et Hugging Face, mais seulement 127 ont été retenus après une sélection rigoureuse (contrôle des erreurs, pertinence des défis, clarté des critères).
Pourquoi ?
1. Qualité médiocre : de nombreux environnements contiennent des erreurs ou ont des critères d’évaluation incohérents.
2. Trop simples ou trop faux : les petits modèles n’ont pas besoin de ces environnements ; mais les grands modèles, très intelligents, peuvent contourner les erreurs pour réussir les tests, sans vraiment apprendre. C’est comme un étudiant qui obtient de bons résultats par chance, sans vraiment comprendre le sujet.
3. Instabilité : OpenAI et Anthropic ont constaté que les performances de l’IA peuvent varier de 6 % selon les configurations informatiques. Un environnement instable rend les résultats d’entraînement imprévisibles.
Qu’est-ce que cela signifie ? La création de ces environnements n’est pas une tâche simple ; c’est un projet à haute complexité et à coût élevé. On ne peut pas compter sur l’IA pour créer ces environnements (la qualité est trop faible), ni sur le travail manuel (c’est trop coûteux). Il faut une compétence spécifique : comprendre les besoins de l’IA et savoir comment construire des environnements virtuels stables, complexes et réalistes.
5. Qui sera le prochain “Scale AI” ? Une nouvelle opportunité émerge
À l’ère des grands modèles, les entreprises spécialisées dans l’annotation de données (Scale AI) étaient valorisées à 29 milliards de dollars. Aujourd’hui, la valeur de ce marché diminue, et la construction d’environnements d’entraînement pour l’IA devient une nouvelle tendance.
- Entreprises start-up :
- UniPat AI : Alibaba est en négociations pour en devenir le principal investisseur ; l’entreprise propose une solution intégrée incluant la conception de tâches, la création d’environnements de test et des critères d’évaluation, pour un montant de 2,5 milliards de dollars.
- Deeptune : Acquise par la plateforme de données Mercor, Deeptune reproduit des environnements réels (comme Salesforce ou Slack) pour aider l’IA à s’entraîner. Mercor l’a acquise pour combler ses lacunes en la création d’environnements.
- Les entreprises spécialisées en Scale AI : Elles développent également des services d’environnements d’apprentissage renforcé, avec près de la moitié de leurs projets dans ce domaine.
- Pourquoi les grands groupes les créent-ils eux-mêmes ?
Bien que la création d’environnements soit une activité rentable, Tencent, Alibaba et ByteDance les développent eux-mêmes. Ces environnements déterminent en effet les limites des modèles, ce qui constitue un secret stratégique. De plus, leur propre infrastructure cloud leur permet de réduire les coûts et de mieux contrôler les processus.
- Quelles sont les opportunités à venir ?
Les grands groupes connaissent bien les modèles et les plateformes cloud, mais qui comprend vraiment les flux de travail réels ? Par exemple, comment fonctionne un système de réservation dans un hôpital ? Quel est le processus de révision des contrats dans un cabinet d’avocats ? Ces logiques commerciales complexes sont peu maîtrisées par les grands groupes et les fournisseurs de cloud. Ainsi, les entreprises qui comprennent à la fois les industries et la création d’environnements d’IA pourraient devenir les prochains géants du secteur.
💡 Conclusion : De la résolution de problèmes à la définition des problèmes
Comme l’a dit Yao Shunyu l’année dernière, l’objectif de la seconde phase du développement de l’IA est de passer de la résolution de problèmes à la définition des problèmes. Cela signifie que, en créant des environnements complexes, nous aidons l’IA à apprendre à identifier, analyser et résoudre des problèmes dans des situations incertaines.
Pour le grand public, cela signifie que les assistants intelligents du futur ne seront plus seulement des interlocuteurs, mais des collaborateurs numériques capables de gérer des tâches administratives complexes, d’écrire et de corriger du code, voire de gérer nos agendas et nos finances.
Pour les investisseurs et les entrepreneurs, les environnements d’entraînement pour l’IA représentent une opportunité majeure. Ce marché est moins coûteux que celui des grands modèles, mais il est plus lié à la mise en œuvre réelle des technologies dans les industries.
En résumé : Auparavant, nous fournissions de l’information à l’IA ; maintenant, nous créons des environnements dans lesquels elle peut s’entraîner. Celui qui créera des environnements plus réels, plus complexes et plus stables permettra à l’IA de fonctionner plus efficacement dans le monde réel.