虎嗅

Atlas ouvre la voie à une reconstruction 3D, plaçant les modèles mondiaux dans une nouvelle phase de mesurabilité

原文:Atlas用3D重建开路,世界模型进入可测量的新阶段

Analyse approfondie : Les modèles mondiaux sont-ils seulement des illusions ou ouvrent-ils de nouvelles perspectives ? – À l’exemple d’Atlas de World Labs

Bonjour à tous, je suis votre journaliste financier et économiste. Aujourd’hui, nous allons aborder un sujet qui a fait beaucoup de bruit dans les cercles technologiques et capitalistes : les modèles mondiaux (World Models).

Si vous suivez l’IA, vous avez probablement entendu parler de Sora, ce modèle capable de générer des vidéos très réalistes, ainsi que de diverses nouvelles sur les robots. Récemment, une entreprise nommée World Labs a lancé un produit appelé Atlas, qui ressemble un peu à Sora, mais dont les fonctions sont complètement différentes.

L’idée principale de cet article est très percutante : le marché des modèles mondiaux évolue actuellement de la simple compétition de beauté visuelle vers celle de précision et d’utilité pratique. De nombreuses entreprises se concentrent encore sur l’amélioration de la qualité visuelle, mais pour une véritable application industrielle, il faut des robots capables de travailler directement dans des espaces numériques.

Voici, en termes simples, les cinq points clés de cet article pour vous aider à comprendre la logique et les opportunités derrière ce changement technologique :

---

1. La différence fondamentale : Sora crée des vidéos, Atlas construit des environnements 3D

Tout d’abord, il est important de clarifier une grande méprise : Atlas n’est pas un générateur de vidéos, c’est un reconstructeur d’espaces 3D.

  • Sora (génération de vidéos) : Vous lui donnez un texte, par exemple “un chat qui court sur l’herbe”, et il vous crée une vidéo. Son objectif est de vérifier si les pixels sont cohérents et si l’image est réaliste. Le produit final est un fichier vidéo destiné à être regardé par les humains.
  • Atlas (modèles mondiaux) : Vous lui donnez quelques photos prises sous différents angles, et il restaure directement un espace 3D. Son objectif est de vérifier si les coordonnées sont correctes et si la structure géométrique est précise. Le produit final n’est pas une image, mais un nuage de points (un ensemble de points avec des coordonnées) ou des ellipsoïdes avec des couleurs et des formes.

Pour faire simple :

  • Sora est comme un peintre qui crée une toile réaliste ; même si elle est très ressemblante, on ne peut pas y entrer.
  • Atlas est comme quelqu’un qui construit une pièce avec des briques de Lego ; cette pièce a des dimensions réelles, et les robots peuvent y entrer, et les programmes peuvent lire directement les données.

Pourquoi c’est important ?

Parce que les robots n’ont pas besoin de “voir” des vidéos ; ils ont besoin de savoir où se trouvent les murs, quelle est la hauteur des meubles, et s’ils peuvent y passer. Atlas fournit des données calculables par les machines, qui constituent la base essentielle de l’intelligence corporelle (intelligence des robots).

---

2. Une percée technologique : du “cartographie professionnelle” à la “prise de vue avec un smartphone”

Auparavant, construire un environnement 3D pour l’entraînement des robots coûtait très cher. Il fallait des lidars professionnels et des dizaines de caméras pour prendre des centaines de photos, puis des ingénieurs passaient des jours à modéliser manuellement. C’était comme faire appel à une équipe de topographie avant de construire une maison : lent et coûteux.

La plus grande nouveauté apportée par Atlas est la réduction drastique des barrières et l’augmentation de l’efficacité :

  • Entrée minimale : Il suffit de deux photos prises avec un smartphone ordinaire, au maximum 25, pour reconstruire un environnement 3D utilisable.
  • Intelligence automatique : Les démonstrations officielles montrent qu’avec une photo de détail d’un bureau, Atlas peut deviner la disposition de toute la pièce ; une photo panoramique complète la position des chaises, et une photo de côté ajoute le moniteur. Il ne s’agit pas simplement de puzzle, mais de comprendre les relations spatiales entre les objets grâce au contexte spatial.
  • Résultats impressionnants : La cour principale de l’université de Stanford a pu être reconstituée à partir de quelques photos prises depuis le sol, permettant de générer des images aériennes continues.

Signification commerciale :

Cela signifie que la création d’environnements 3D est passée du niveau “professionnel” au niveau “consommateur”. Même les ingénieurs non spécialisés peuvent utiliser leur smartphone pour prendre quelques photos et générer en quelques minutes un environnement virtuel utilisable pour l’entraînement des robots. La coût de collecte de données a chuté de façon spectaculaire, ce qui est un prérequis essentiel pour l’explosion de l’industrie.

---

3. La capacité clé : permettre aux robots de “voir” et de “prévoir” l’avenir

Atlas ne se contente pas de transformer des photos en modèles 3D ; il peut également contrôler l’angle de vue et le temps, ce qui le distingue des logiciels de modélisation 3D classiques.

  • Génération de caméras contrôlée : Vous pouvez dire à Atlas : “Je veux voir cette scène depuis un angle de 45 degrés à gauche, puis que la caméra s’éloigne progressivement.” Il générera alors une vidéo en 1440p avec une durée maximale de 1 minute, suivant la trajectoire spécifiée.
  • Avantage comparatif : D’autres modèles utilisent des descriptions textuelles pour commander les mouvements de la caméra (par exemple “Déplacez la caméra vers la gauche”), ce qui peut entraîner des erreurs. Atlas utilise des coordonnées, ce qui garantit une grande précision. Dans des tests aveugles, Atlas a une supériorité allant de 75 % à 94 % par rapport aux autres modèles, surtout pour les mouvements complexes.
  • Simulation temporelle et spatiale : C’est la fonction la plus cool. En enregistrant une vidéo avec plusieurs smartphones, Atlas peut “geler” le temps et vous permettre de revoir un instant depuis n’importe quel angle.
  • Auparavant : Cela nécessitait des dizaines de caméras synchronisées et coûtait des centaines de milliers d’euros.
  • Maintenant : Quelques smartphones + Atlas suffisent.

Pour les robots :

Cela n’est pas seulement pour le plaisir. Lors de l’entraînement des robots, nous devons savoir “Qu’est-ce que la caméra verra si je fais un pas à gauche ?” Atlas peut générer en temps réel les images en RGB et les données de profondeur que les capteurs du robot devraient percevoir. De plus, un même environnement réel peut générer des milliers de variations (en changeant l’éclairage, en déplaçant des obstacles, en modifiant le parcours), sans avoir à reconstruire l’environnement.

En une phrase : Il suffit de visiter le monde réel une fois pour utiliser l’environnement numérique d’innombrables fois. Le rôle principal dans la collecte de données passe des “robots réels” aux “robots virtuels”.

---

4. Le point faible majeur : Atlas ne fait que “recouvrir la surface”, pas “analyser l’intérieur”

Bien que Atlas soit très performant, l’article souligne honnêtement ses limites intrinsèques : il ne comprend que la géométrie, pas la physique.

  • Qu’est-ce qu’il est ? Un réducteur d’images de haute précision. Il peut “dessiner” une scène et savoir où se trouvent les objets et à quoi ils ressemblent.
  • Qu’est-ce qu’il n’est pas ? Ce n’est pas un moteur physique. Il ne sait pas si les objets sont multiples, quel est leur coefficient de frottement, comment ils se déformeront sous l’effet des forces, ou s’ils vont se heurter.
  • Exemple : Atlas sait qu’il y a une pomme sur la table, mais il ne sait pas si elle est molle ou dure, ni à quelle distance elle roulera en cas de poussée, ni si elle se brisera. Ces propriétés physiques ne sont pas visibles sur les photos et ne peuvent pas être calculées par Atlas.
  • Barrier technologique : La fonction de optimisation d’Atlas vise la réalisme de l’image, pas la **précision physique*. Dans le processus de simulation, il se contente de fournir des données visuelles ; les calculs physiques doivent être effectués par des moteurs externes tels que MuJoCo ou PhysX.

Pour faire simple :

Atlas est comme un directeur artistique de haut niveau qui peut créer des images très réalistes, mais il ne comprend pas la **mécanique*. Il sait que le mur est rouge, mais il ne sait pas s’il peut supporter un poids. Si un robot heurte le mur, Atlas peut dessiner l’effet visuel de l’impact, mais il ne peut pas calculer la force de l’impact ou si le robot sera endommagé.

C’est pourquoi World Labs a acquis SceniX :

SceniX est spécialisé dans l’ajout de propriétés physiques (masse, frottement, élasticité) aux objets virtuels. World Labs (géométrie) + SceniX (physique) = un cycle complet de Real-to-Sim-to-Real (du réel à la simulation et retour au réel).

---

5. Perspectives pour l’industrie : de la “perception” à la “compréhension”

Enfin, regardons l’évolution de l’industrie dans son ensemble :

  • Étape actuelle : La plupart des entreprises se concentrent encore sur la reconstruction géométrique et la **génération visuelle*. Celui qui peut transformer des photos en environnements 3D les plus réalistes gagne la première manche.
  • Concurrence future : La véritable compétition se jouera sur l’unification des propriétés physiques.
  • La géométrie peut être déduite des photos par des algorithmes.
  • Mais les paramètres physiques (comme la résistance des câbles, le type de tissu, le frottement des articulations) doivent être définis par des interactions physiques réelles.
  • Les modèles mondiaux du futur devront pouvoir unifier la structure spatiale et les règles physiques dans un seul modèle.

Implications pour les investisseurs :

1. Prêtez attention à la capacité de mise en œuvre de “Sim2Real” (de la simulation au réel) : Ne vous contentez pas de la beauté des démonstrations vidéo ; vérifiez si les robots peuvent être entraînés en simulation et passer ensuite directement sur des robots réels sans aucune adaptation, et fonctionner de manière stable. Les démonstrations de World Labs montrent que leurs bras robotiques peuvent manipuler des câbles et des objets déformables en toute autonomie pendant une heure sans intervention humaine ; c’est là que réside le véritable obstacle technologique.

2. Le coût des données est un avantage majeur : Celui qui peut générer des données d’entraînement de la plus haute qualité à moindre coût (avec des photos de smartphones) réduira les barrières de développement pour les entreprises de robots et occupera ainsi une position dominante dans l’écosystème.

3. La fusion des moteurs physiques et des modèles visuels est la prochaine tendance : Les entreprises qui se concentrent uniquement sur la vision ou sur la physique risquent d’être intégrées. Des entreprises comme World Labs, qui combinent les deux, ont plus de chances de devenir le “système d’exploitation” de l’intelligence corporelle.

En résumé :

L’apparition d’Atlas marque une étape clé dans le passage des modèles mondiaux d’un concept académique à une application industrielle réelle. Il a résolu le problème de la représentation du monde, mais la question de son fonctionnement physique reste à résoudre avec l’aide de moteurs physiques.

L’essence de cette compétition n’est pas de voir qui peut générer les vidéos les plus impressionnantes, mais de savoir qui peut fournir aux robots un environnement d’entraînement numérique plus réel, moins coûteux et plus pratique. Le jour où la géométrie et la physique seront vraiment intégrées, l’industrie de l’intelligence corporelle connaîtra un véritable tournant.