虎嗅

**日本語訳:** 「汎用人工知能を追い求めて、世界中のモデルが多方面から進展している」

原文:追逐通用人工智能,世界模型多头并进

本文の要約

本稿では、AI分野における「ワールドモデル(World Model)」について論じています。現在の大言語モデル(ChatGPTなど)は、実世界での経験が不足しているため、物理的推論や空間計画といったタスクにおいて重大な欠点を抱えています。一方で、ワールドモデルは現実の結果をシミュレートすることができるシステムであり、汎用人工知能(AGI)への重要な道筋と見なされています。また、ワールドモデルの認知科学における背景や商業化の進展(資本の流入や主要企業の参入)、技術的アプローチの違い(ピクセルレベルでの再構築 vs 抽象的表現)、そしてAGIへの到達までに残された課題(時間の抽象化やメタ認知など)についても紹介しています。

詳細な解説

1. 大言語モデルの「致命的な欠点:現実世界の『常識』がない」

簡単な例で説明しましょう。AIに「コップを床に落とすとどうなるか?」と尋ねると、専門用語(重力ポテンシャルエネルギーや応力波)を並べ立てますが、5、6歳の子供なら「コップが割れる」と答えます。なぜでしょうか?それは、大言語モデル(LLM)の核心が「次に出てくる単語を予測すること」であり、大量のテキストを用いて訓練されているものの、実際にコップが床に落ちるのを見たことがないからです。現実世界の経験がなければ、物理法則を真に理解することはできません。

例えばナビゲーションではルートを暗記できても、迂回路を指示されると混乱します(文字情報しか持っておらず、人間のような「心的地図」がないからです)。また、服をたたむといった日常的なタスクも全くできません。これがLLMの本質的な欠点です——それは「テキストの専門家」であり、「現実の専門家」ではありません。

2. ワールドモデル:AIに人間のように結果を予測させるシステム

ワールドモデルのアイデアは、1943年の心理学者クレックに遡ります。人間の脳には異なる行動の結果をシミュレートする「小さなモデル」があると考えられています(例えば、「コップを床に落とすと割れる」と思うと、意図的に触れないようになります)。その後の「予測処理理論」では、人間の知覚は常に世界を予測し、目や耳からの情報でそれを修正するとされています。

AI研究者たちは、AIも同様の能力を持たせたいと考えています。行動する前に内部で結果をシミュレートし、現実世界での間違いを避けるのです。例えばトゥーリング賞受賞者のヤン・リクンは「予測能力のないAIは真の知能ではない。知能とは、私たちの代わりに試行錯誤することだ」と述べています。

3. 資本が集中する新しいAI分野:ワールドモデル

過去2年間で、ワールドモデルは資本や大企業から注目を集めています。

  • AIの権威リー・フェイフェイが設立したWorld Labsは2億3000万ドルを調達し、「空間知能」の研究を行っている。
  • ヤン・リクンはMetaを離れ、AMIラボを設立して1億ドルを調達し、ワールドモデルの開発に専念している。
  • Google DeepMindのDreamer4システムは『マイワールド』の動画を大量に観ており、資源を集めたり道具を作ったりするといった複雑なタスクを自ら行うことができる。

しかし、これらはまだプロトタイプに過ぎません。例えばWorld LabsのMarbleは3Dシーン生成器に過ぎず、Genie3はゲームシミュレーターのようなものです。実際に家事をこなせるロボットにはまだ遠い道のりがあります。

4. 技術的アプローチの対立:ピクセルレベルでの再構築 vs 抽象的表現

現在、2つの主要な技術アプローチが存在し、激しい議論が交わされています。

  • ピクセルレベルでの再構築:Dreamer4のように、行動後の世界を正確にシミュレートするために各ピクセルを再構築するアプローチです。利点は詳細が豊富だが、データ量が多い。
  • 抽象的表現:ヤン・リクンのJEPAアプローチでは、詳細を再現せず、推論に必要な重要情報のみを抽出する。利点はデータ量が少ないが、抽象化された情報だけで複雑な推論が可能かどうかが問題となる。例えばV-JEPA2は物体の動きの法則を学ぶことができるが、開放環境での知能体として機能するかはまだ証明されていない。

両アプローチにはそれぞれ理論的な根拠があります。Dreamer4の責任者ハフナーはピクセルレベルでも抽象化を学ぶことができると主張する一方、ヤン・リクンは抽象的表現の方が効率的だと考えています。

5. AGIへの道のり:ワールドモデルだけでは不十分

ワールドモデルが完璧になったとしても、AGI(人間のように何でもできる知能)にはまだ多くの課題が残っています。

  • 時間の抽象化:AIは現在、1秒後のことしか予測できず、「長期的な結果」を考えることができない(例えば「今勉強すれば将来良い仕事に就ける」という思考)。
  • メタ認知:AIは自分が何を理解しているかを把握できず、間違っていても気づかない。
  • 複雑な因果関係や他人の思考:人間は複雑な因果関係(例えば「雨が降っているから道が滑る」)を理解し、他人の意図(例えば「彼が眉をひそめているのは怒っているから」と推測することができますが、AIにはできない。

専門家によれば、ワールドモデルは必要条件ではあるものの十分条件ではない。AGIにはさらなる能力が必要だ。

まとめ

ワールドモデルはAIがAGIへと進む上で重要なステップですが、万能薬ではありません。AIを本当に人間のように考えさせるためには、まだ長い道のりが待っています。