虎嗅

中国のニュースヘッドラインを日本語に翻訳します: 「世界中で話題のモデル、GPT-6がロボットにも手を伸ばす:『具身化された脳』の支配権は誰が握るのか?| AI 100の非公開会議」

原文:世界模型爆火,GPT-6把手伸向机器人:具身大脑到底谁说了算?| AI 100 闭门会

一、ニュースの核心内容をわかりやすくまとめる

最近、AI業界で非常に象徴的な動きがありました。以前は人型ロボットについて話すとき、関節の動きの柔軟性やモーターのパワーといった「体の部分」の指標に注目が集まっていましたが、今では業界全体が「ロボットの頭脳」という分野に注目を向け始めています。

きっかけは、OpenAIが人型ロボットの開発に参入すると発表したことでした。その直後に公開されたGPT-6 Astraは、簡単な物の取り扱いでは95%の成功率を示しましたが、プラグをコンセントに差し込むような複雑な作業では成功率が10%にまで下がりました。これは、最も優れた大規模モデルでさえも物理的な現実世界に入るとその能力が大幅に低下することを意味しています。

業界はようやく気づきました。大規模モデルはデジタル世界ではコピーライティングや画像作成には優れていますが、現実世界では物が滑ったり倒れたり、少しの衝撃で位置が変わったりするような複雑な状況には対応できないのです。すでに資金が動いており、上半期に国内のアバター型インテリジェンス分野での総融資額は400億円を超え、その半分以上が「ロボットの頭脳」を開発する企業に投じられました。そのうち7割は現在最も注目されている「ワールドモデル」の開発に使われています。しかし問題は、第三者による実際のテストでは12のオープンソースのアバター型モデルの中で複雑なタスクの成功率が最大で16.7%に過ぎないことです。これほど大々的に宣伝されているワールドモデルがロボットにどれだけの実際の能力をもたらすのか、業界全体で共通の認識がありません。

そこで今回、業界は第一線の起業家、投資家、大学の教授たちを集めて非公開の会議を開き、概念を語るのではなく、4つの最も重要な問題について真剣に議論しました。ワールドモデルは本当にロボットの頭脳として必要なのか?どのような頭脳が実際に仕事をこなせるのか?現在の数十億円、数百億円の評価額は本当の技術に基づくのか、それとも早すぎるバブルなのか?来年どの技術が実際に実用化されるのか?9月22日のライブ配信では業界全体の関係者に情報を公開し、1年後に結果を公開するという目標を設定しました。

---

二、ポイントごとのわかりやすい解説

1. 業界の現実

多くの人は、人型ロボットの関節を人間と同じように柔軟にすれば工場で働いたり家事をしたりできると思っていましたが、OpenAIのテストによってその幻想が打ち砕かれました。関節の精度が人間よりも高くても、頭脳が次に何が起こるかを予測できなければ、複雑な作業はできません。

以前の大規模モデルはすべてデジタル世界で訓練されており、現実世界のさまざまな予期せぬ状況(例えば、カップに水がついて滑る、柔らかいパンを掴むと形が変わる、地面に小石があるとつまずく)には対応できませんでした。これらは当たり前のことですが、大規模モデルにはまったく理解がありませんでした。今ではロボットの「身体」のハードウェアはほぼ基準に達していますが、「頭脳」の能力はまだ3歳児レベルにとどまっています。業界全体がアバター型インテリジェンスに集中しているのは、これまでのアプローチではもう行き詰まっているからです。

2. 今注目されている「ワールドモデル」の本質

「ワールドモデル」とは、ロボットに「人間レベルの予測能力」を与えることを意味します。しかし、10社に「ワールドモデルとは何か」と尋ねると、8社が異なる答えをします。ある企業は「ロボットが数秒後に見る画像を生成できるものがワールドモデルだ」と言い、別の企業は「ロボットが練習用の仮想環境を大量に生成できるものがワールドモデルだ」と言い、また別の企業は「ロボットが物を掴む際にカップを壊さないかを予測できるものがワールドモデルだ」と言います。

要するに、人間が何十年もかけて身につけた物理的な常識をロボットに移植しようとしているのです。例えば、テーブルの上の水杯を押すときに、水が手にかかる前にその結果を予測し、動作を調整できるようにすることです。しかし、現在のワールドモデルの90%は「生成された仮想映像が非常にリアルだ」という段階にとどまっており、物理法則を理解し、それに基づいて実際に動作するにはまだ遠いです。

3. 資本の投資対象

上半期の400億円の融資の半分以上がアバター型インテリジェンス分野に流れましたが、その多くは「ロボットの頭脳」を開発する企業に投じられました。しかし、多くの企業はまだ10秒間のデモしか出しておらず、その評価額は数十億円に達しています。資本が熱狂的に投資する理由は簡単です。将来、人型ロボットが普及すれば、すべてのロボットが自分で頭脳システムを開発することは不可能であり、最終的にはすべてのロボットが使用できる共通の「インテリジェントな基盤システム」が登場するでしょう。それを最初に開発した企業は、現在のAndroidやNVIDIAのように巨大なビジネスを築くことになります。しかし、バブルも大きいです。多くの企業はロボットが連続してタスクを実行した際の実際のデータさえ持っておらず、PPTでワールドモデルの話をして評価額を吊り上げています。今回の非公開会議では、第一線の投資家が集まり、「本当の技術」と「バブル」の境界線を明確にすることが目的です。これからはデモだけで評価するのではなく、ロボットが複雑なタスクを実行する成功率が何倍にも上がり、新しい作業に移行する際に数ヶ月かけてコードを書き直す必要がなくなるかどうかが重要です。それが本当の突破口です。

4. 将来、ロボットのコントロール権を握るのは誰か?

現在、業界内には二つの対立する見解があります。ロボットの「体」を製造する企業は、「自分の関節の動きやハードウェアのパラメーターを最もよく知っているのだから、なぜインテリジェントなコントロール権を第三者の企業に渡さなければならないのか」と主張しています。一方で、頭脳を開発する企業は、「数十億円、数百億円をかけて開発した汎用モデルをカスタマイズしてもコストは回収できない。最終的には第三者の汎用頭脳の方がコストパフォーマンスが最も良い」と主張しています。

最終的には、現在の自動車業界と同じようになるでしょう。資金に余裕のある大手企業は自社で頭脳を開発し、中小のロボットメーカーは第三者の汎用頭脳ソリューションを購入するでしょう。しかし、勝者は誰かではなく、どの企業が実際に多くのデータを持っているかにかかっています。つまり、ロボットが現実世界でどれだけの時間を動いてどれだけの経験を積んでいるかが重要です。使用するロボットが多ければ多いほど、頭脳のエラーのリスクが減り、進化も速くなります。データこそが最終的な決定権を握るものです。

5. アバター型インテリジェンスが本当に成熟しているかを判断するには、クールなデモではなくこれら6つの指標を見る

将来的には、一般の人でも誰が本当に実用化されている技術を持っているかを一目で判断できるようになります。クールな10秒間のデモビデオではなく、以下の6つの実際の指標を見る必要があります:

① 同じタスクを100回連続で実行した際の成功率

② 物体の位置を変えたり、部屋の照明を半分消したり、床に障害物を置いたりしたときの成功率

③ タスクの途中でエラーが発生したときに自動的に調整して続けられるか

⑤ これまで学んだことのない新しいタスクを与えたときに、システムをどれだけの時間とコストで修正できるか

⑥ この頭脳を別の型のロボットに搭載するのにどれだけの時間とコストがかかるか

⑦ 100回のタスクの中で人が手を出して助ける必要がある回数の割合

これらの指標が90%以上であれば、そのロボットは本当に工場や家庭で実用化され、収益を生むことができると言えます。業界全体も融資に頼らずに成長できるようになるでしょう。