一、核心内容の要約
これは香港の複数の高等教育機関に所属するAI分野の若手研究者たちが参加した業界の円卓討論会であり、概念を煽ったり流行を追ったりすることなく、現在非常に注目されているが定義が非常にあいまいな「ワールドモデル」の実現における問題点を具体的に分析していました。多くの人が「AIが動画を生成できればそれがワールドモデルだ」と誤解している点を正し、また「インターネット上の動画を集めれば汎用ロボットが作れる」「すぐにロボット版のChatGPTが登場する」といった幻想も打ち破りました。さらに、業界でよく言われる「百万時間のトレーニング量」が実際には意味のない数字であるという反常的な判断も示されました。最終的に研究者たちは、現在のワールドモデルの技術的な方向性はまだ確定しておらず、大企業だけが参加できる資本ゲームではなく、小規模なチームや起業家も特定のシナリオから入り込むことで多くのチャンスがあるという共通認識に達しました。
---
二、分かりやすい解説
1. 現在市場に出回っている「ワールドモデル」の99%は未熟なもの
多くの人は、AIが猫が水杯を倒すような連続した動画を生成できればそれがワールドモデルだと考えていますが、実際には全く異なるものです。現在の動画生成AIは、視覚的に馴染みやすいようにピクセルを組み合わせているだけで、水杯が地面に落ちて割れたり、水が流れ出たりすることを理解していません。さらに、水杯がテーブルの角に隠れて見えなくなっても、そのまま動画を生成し続けます。
研究者たちにとって、真のワールドモデルとは「次のフレームを予測する」能力ではなく、人間のように現実世界の法則を理解することが重要です。例えば、ロボットにカップを押させると、どれだけ滑ってどれだけ水が飛ぶかを事前に予測し、カップが隠れていてもそのまま存在することを認識する必要があります。現在、動画生成や自動運転、ロボット開発を行っているチームは皆「ワールドモデル」と言っていますが、実際には全く異なるアプローチを取っており、まだ統合される日は遠いです。
2. インターネット上の動画を集めて汎用ロボットを作る?そんなに簡単ではない
以前は、ChatGPTがインターネット上のすべてのテキストを学んで汎用モデルになったという幻想がありましたが、もしTikTokやBilibiliの動画をすべてロボットに与えたとしても、何でもできる汎用ロボットが作れるわけではありません。研究者たちはこの考えを否定しました。インターネット上の動画は「成功した瞬間」だけが表示されており、人がカップを落としたり料理中に指を切ったりする失敗した瞬間はほとんど見られません。ロボットが学ぶべきは「どのような状況で失敗するか」であり、これらのデータはインターネット上では得られません。また、人間がGoProで撮影した動画も、人間の手の柔軟性や動きは機械アームやヒューマノイドロボットとは異なります。オリンピックのダイビング動画を100回見ても、実際に自分でダイビングするときは同じようにはいきません。インターネット上の動画はロボットの「入門教材」に過ぎず、実際の環境での経験には代わりになりません。
3. 「具身型AIのChatGPT」の時代が来たなんて言わないでください。まだ基準にも達していない
最近、多くのロボット企業がデモを公開し、ドアを開けたり水を注いだりする機能を示して「具身型AIの時代が来た」と宣伝していますが、研究者たちはこれを単なるマーケティングのトリックだと指摘しています。ChatGPTの核心的な能力は「これまで見たことのない問題にも信頼できる答えを出すこと」ですが、現在のロボットが「命令に従って動く」のは、以前に学んだ動作を再利用しているに過ぎません。例えば、オフィスのドアのように手が丸くて軽い場合と、古い家のドアのように手が四角くて鍵がかかっている場合では、ロボットは対応できません。ロボットの汎用性はChatGPTのように突然現れるわけではなく、まず工場での実用性を確立してから一般家庭に進出する必要があります。
4. 業界が誇張する「百万時間のトレーニング量」はほとんど意味がない
多くの具身型AI企業は「私たちのロボットは10万時間、100万時間のトレーニングを経ている」と宣伝していますが、研究者たちはこれは単なる宣伝用の数字に過ぎないと指摘しています。例えば、掃除ロボットが毎日同じルートを100時間回っても新しい情報は得られません。言語モデルでは「トークン」を使ってデータ量を計算していましたが、ロボットの場合は同じ動作を何万回も繰り返しても意味がありません。将来のロボットの有効なデータの単位は「重要な動作の変化回数」であり、新しい物体に遭遇したか、動作に失敗したか、物を動かしたかなどが重要です。
5. 未来のロボットの「脳」は、個々の身体に合わせてカスタマイズする必要はない
現在のロボットには、機械アームの長さを変えるとすべての制御プログラムが無効になるという問題がありますが、人間にはそのような問題はありません。厚手の手袋を着たり、長いプライスを使ったりすればすぐに使い方がわかります。未来のワールドモデルは、「一つの脳でさまざまな身体に対応できる」汎用性を持つ必要があります。手の数や力の強さに関わらず、自分の身体の限界をすぐに理解し、自動的に動作を調整できるようになる必要があります。このような能力が実現すれば、ロボットの実用化コストも大幅に下がるでしょう。