虎嗅

【李飞飞のWorld Labsが新たに発表した世界モデル――本当に「リアルな世界」を再現しているのか?】

原文:李飞飞的World Labs新发布的世界模型,是真的世界模型吗?

核心内容の要約

World Labsが発表したAtlasは、単なる「絵を描くツール」ではなく、マシンが利用できる構造化された三次元世界を生成する「世界シミュレーター」です。デプスマップ、ポイントクラウド、3Dガウススポットなどの技術を用いて、普通の写真を測定可能な三次元データ(例えばカップの直径やテーブルから壁までの距離)に変換し、実際の写真とAIを組み合わせてロボットが仮想環境で訓練できるようにします(実際のデータなしで実機で直接使用可能)。その最大の革新点は、単に「見た目を美しくする」レンダラーから、「マシンが作業を行う」シミュレーターへと進化したことであり、AI生成と産業応用の間のギャップを埋めたことです。

一、Atlas:「絵を描く」のではなく、「データを記憶する」シミュレーター

この記事ではAIシステムを3つのレベルに分けています:

  • レンダラー:美しい画像を生成するだけのもので、方向キーを押すと対応する視点を生成しますが、カップの高さやテーブルが壁からどれだけ離れているかは分かりません(マシンはこれらの情報を必要としません);
  • シミュレーター:カップの位置、テーブルのサイズ、ドアがどれだけ開いているかなど、世界の状態を記憶し、必要な時にいつでもデータを呼び出せるようにするもので、ロボットアームがこれらの情報を基に物を取ることができます;
  • プランナー:さらに高度で、物がどこにあるかだけでなく、「今取るべきか、どの角度から取ると最も安定するか」も判断できるものです。

Atlasはシミュレーターに分類されます。例えばキッチンの写真を撮ると、各ピクセルの深度(カメラからの距離)を計算し、数百万個の点を使ってキッチンの形状を再構築し、小さなスポットを使って3Dシーンを作り出します。これらの結果は人間が見るためのものではなく、ゲームエンジンやデザインソフトウェア、またはロボットアームの制御コードに直接導入できます。

二、Atlasの「賢さ」:「位置記憶」を使って大きな問題を解決する

Atlasの技術的な革新点は多モーダル入力と空間記憶にあります:

  • 多モーダル入力:テキスト、画像、カメラの位置と向き(6つの数値で表される)、デプスマップを同時に受け取ります。例えばドアの前と窓辺からそれぞれソファの写真を撮ると、通常のモデルでは別の画像として扱われますが、Atlasは「どれだけ歩いたか、どれだけ回ったか」を把握しているため、同じソファだと認識できます;
  • 空間記憶:前世代の製品RTFMには問題がありました——仮想の家を30分間見ても、多すぎる画像を保存すると計算能力が足りなかったり、記憶が曖昧になったりします(キッチンに戻るとテーブルの位置が変わっていたりします)。Atlasは「位置をインデックスとして使用」し、キッチンがどのような状態かを知りたい場合は、キッチンの近くで撮影された写真を直接探します(まるで会議室に入ると、先週の会議の詳細をすぐに思い出せるように)。

三、「現実を再現しながら」「AIで補完する」:三次元シーンの新しい使い方

これまで三次元シーンを作るには2つの方法がありました:

  • 再構築:実際の写真を使って再現するが、撮影できなかった部分は空白のままです(例えばFunes Worldプロジェクトでは、実際の建物のバックアップを作りますが、欠けている部分は補われません);
  • 生成:AIが常識に基づいて存在しない部分を作り出します。

Atlasはこれら2つの方法を組み合わせています:写真が多ければ少なく作り、写真が少なければ多く作ります。例えば庭の写真が1枚だけあれば、周囲の建物を補います;小屋の写真があれば、補われた部分を実際のものに変えます。ロボットにとって、壁に描かれた模様が作り物か実際のものかは重要ではありません。壁の位置とサイズが正しければ、ロボットアームはぶつからないのです。

四、ロボットに「仮想世界での訓練」を可能にする:シミュレーターの核心的な価値

Atlasの最大の応用シナリオはロボットの訓練です:

  • World Labsはロボット会社SceniXを買収し、Atlasシミュレーターを使ってロボットを訓練しています:実際のデータを一切使用せずに、実機に直接組み込んで箱詰め、ワイヤーの巻き取り、試験管の移動などの作業を行い、中には人の介入なしで1時間連続して動作するものもあります;
  • シミュレーターは現実と完全に同じである必要はありません:例えばシミュレーター内の壁の摩擦係数が実際の壁と異なっても、「シミュレーターでのA案がB案よりも良いなら、実機でも同じように動作する」「シミュレーターがどのステップで失敗しやすいかを示せば、実機でも同じように失敗する」で十分です(例えばライト兄弟の風洞は実際の海風とは異なりますが、翼の性能を比較できます)。

これにより、ロボット訓練の大きな問題が解決されます:現実世界では失敗するとコストがかかります(例えばロボットアームが物を壊す)が、シミュレーターでは何千回も試行でき、失敗の経験を迅速に積むことができます。

五、ImageNetからAtlasへ:李飛飛(リー・フェイフェイ)チームの「世界モデル」への道のり

李飛飛チームが2009年に作ったImageNetは、インターネット上の写真を分類し、マシンに「物を認識させる」ものでした(例えば写真の中のカップを認識させる)。現在のAtlasは、「物がどのように配置されているか」を理解することを目指しています:カップがテーブルの上にどのように置かれているか、押された後にどこに移動するか、テーブルの後ろに回ると同じカップかどうかなどです。

これには2つのアプローチの違いがあります:

  • 一方のアプローチは、十分なビデオデータを与えれば三次元構造が自然と形成されると考えています(例えばMetaのV-JEPA 2);
  • もう一方のアプローチ(Atlas)は、カメラの位置、幾何学的情報、物理的制約を直接モデルに組み込み、世界に最初から構造を持たせます。

Atlasのアプローチの方が実用的です:三次元データはテキスト(インターネット上に大量のコーパスがある)とは異なり、空間関係や相互作用を記録するのが難しいため、モデルに直接ルールを与える方が効率的です。

最後:Atlasが解決しようとしているのは、「仮想世界をインタラクティブにすること」

記事の最後では『モレルの発明』と比較しています:モレルのマシンは1週間のシーンを完璧に再現できますが、起こらなかったことは何もできません(例えばカップを倒す)。しかしAtlasの目指すのは、仮想世界を「生きたもの」にすることです——再現するだけでなく、ロボットが中で手を伸ばしたり、物に触れたり、試行錯誤を行えるようにすることです。これこそが真の「世界シミュレーター」です。

一般の人にとってAtlasはすぐには生活に直接影響を与えないかもしれませんが、ロボット、工業デザイン、デジタルツインなどの分野をより効率的にするでしょう。例えば、将来的にはロボットアームが実際の工場で何度も試行錯誤する必要なく、Atlasの仮想世界で十分に訓練した後に実際の仕事に就けるようになるでしょう。これが技術が「見た目が良い」から「使いやすい」へと進化するための重要なステップです。