虎嗅

中国のニュースヘッドライン: 「GPT-6はあらゆるものを認識できるが、具身化された基盤モデルには何が残されているのか?」

原文:GPT-6认出了万物,具身基座模型还剩什么

ロボット業界における「次元削減の打撃」?GPT-6 Astraがどのように具身知能のゲームのルールを書き換えるのか

皆さん、こんにちは。私は財経ジャーナリストであり経済学者です。今日は非常に興味深い業界に関する深い記事についてお話しします。

簡単に言うと、過去2年間、ロボット業界(具身知能)ではこのような話が続いていました。「大規模なモデルは確かに賢いが、物理世界を理解していない。だからロボット専用の‘脳’(ベースモデル)を訓練する必要がある」と。

しかし、OpenAIが最近発表したGPT-6 Astraの登場により、この話に大きな疑問符がつきました。なぜなら、Astraは驚くべき能力を示したからです。特別な訓練を受けていないにもかかわらず、一枚の画像だけでインタラクティブなシミュレーション環境を再現できたのです。

これは、キッチンに入ったことのない人が料理の写真を見て、すべての食材を認識し、それらがどこに置かれるべきかを知り、さらには料理のプロセスをシミュレートできるようなものです(もちろん味はおそらく正しくないでしょう)。

これは、ロボットの「脳」を訓練するために多額の資金を投じているスタートアップ企業にとって大きな警鐘です。以下では、この業界の変化を5つの側面からわかりやすく解説します。

---

1. 核心内容:「画像を見て話す」から「世界を構築する」まで、Astraは何をしたのか?

まず、Astraがどのような能力を示したのか、そしてなぜそれが恐ろしいのかを明らかにしましょう。

以前は、ロボットに物理世界を理解させることは「Real2Sim」(実世界からシミュレーション世界へ)という難しい問題でした。例えば、ロボットにテーブルの上にカップと液体がある写真を見せても、通常は「これはカップ」「これは水」としか認識できませんでした。

しかし今回、開発者はこの写真をAstraに渡し、インタラクティブなシミュレーション環境を生成するように要求しました。その結果、Astraは以下を実現しました:

  • 物品の認識:それが容器と液体であることを知る。
  • 空間の理解:液体が容器の中にあり、容器がテーブルの上にあることを知る。
  • 詳細の再現:液体の色を非常にリアルに再現する。
  • コードの生成:これらの静的な画像を実行可能なプログラムシーンに変換する。

重要な点は、Astraはこのシナリオのために特別な訓練を受けていなかったということです。ただ大量のインターネットの画像や動画、マニュアルを「見る」ことでこれらを学んだのです。

唯一の欠点:液体が混ざった後の化学反応をシミュレートできなかったことです。水がどのようなものかは知っているが、水と硫酸を混ぜると爆発することは知りません。つまり、視覚は理解しているが、深い物理的な因果関係はまだ理解していないのです。

簡単に言うと、Astraは本をたくさん読んだが実際には何もしていないインターンのようなものです。世界の99%の一般的な物品を認識し、大まかな使い方は知っていますが、実際に触ったことがないので、摩擦力がどれほどか、力をどれだけ加えるべきかはわかりません。

---

2. 認知の危機:「リンゴを認識する」ことがもはや優位性ではない

記事によると、GPT-6の登場により、具身知能のスタートアップ企業の生存空間が直接圧迫されています。特に「ベースモデル」の話を続けている企業にとってはそうです。

以前は、ロボットにテーブルの上のリンゴを認識させることが技術的な能力であり、売りポイントでした。

しかし今では、GPT-6のような汎用的な多モーダルモデルは、膨大な訓練データ(インターネット上のすべての画像、動画、論文を含む)により、非常に広範な「物理世界の図鑑」を構築しています。

  • カップを持ったことはないが、無数の人がカップを持つのを見ている。
  • 工場に入ったことはないが、ロボットアームや流れ作業線を認識できる。
  • 引き出しを開けたことはないが、取っ手がどこにあるか、引き出しをどのように引くかを知っている。

つまり、「物品を認識する」と「シナリオを理解する」ことが一般的な能力になり、「文字を読む」のと同じように、もはや希少なスキルではなくなっています。

スタートアップ企業にとっては、もし「私のロボットは命令を理解し、物体を認識できる」というのが唯一の売りポイントなら、OpenAIのような巨人と直接競争することになります。計算能力、データの規模、イテレーションの速度では、スタートアップ企業は勝てません。新たに「大規模で包括的な」汎用モデルを訓練することはコストがかかるだけでなく、汎用モデルが既に行った作業を繰り返すだけになる可能性が高いです。

簡単に言うと、以前は「理解できる」ことが能力でしたが、今では「理解できる」ことが当たり前です。もし「理解する」ことだけで生計を立てているなら、その仕事は汎用モデルに奪われるでしょう。

---

3. 能力の限界:なぜAstraは「化学反応」をシミュレートできなかったのか?

ここに非常に興味深い点があり、それが「汎用モデル」と「具身知能」の重要な違いです。

Astraは液体の色を再現しましたが、液体が混ざった後の反応はシミュレートできませんでした。なぜでしょうか?

  • 色は視覚情報であり、大量の画像から学ぶことができる。
  • 化学反応には材料の性質、物理的法則、因果関係が関わっており、より正確なデータとモデルが必要です。

これは重要な論理を明らかにしています。「物品を認識する」ことは、それを信頼できるように操作できるとは限りません。

ロボットはカップの位置を正確に指摘し、「手を伸ばし、掴み、持ち上げる」というステップを生成できます。しかし実際に行うときには:

  • チャックはどれだけの力を必要とするのか?
  • **接触点が2ミリメートルずれると滑ってしまうのか?
  • **カップの中の液体が動いた後、速度をどのように調整するのか?
  • 異なる素材の摩擦力はどれほどか?

これらはすべて「実世界からのフィードバック」、つまり「触覚」「力覚」「失敗の経験」が必要です。汎用モデル(例えばAstra)にはこれらの「身体的経験」が欠けています。カップがどのようなものかは知っていますが、カップの重さや滑りやすさ、壊れやすさはわかりません。

簡単に言うと、Astraは理論家です。どのように行うかは知っていますが、実際にどのような感覚かはわかりません。具身知能の価値は、この「感覚」の空白を埋めることにあります。

---

4. 価値の移行:「脳」から「身体的経験」へ

汎用モデルが「認知」の問題を解決したのであれば、具身知能のスタートアップ企業のチャンスはどこにあるのでしょうか?記事は非常に明確な判断を下しています。価値は後方に移動しています。

将来の分業のロジックは以下の3層に再構築されるかもしれません:

1. 上層(認知層): GPT-6レベルの汎用モデルが提供する。命令の理解、物品の認識、タスクのステップの計画を担当する。

2. 中層(動作予測層): 具身モデルが担当する。動作後に環境がどのように変化するかを予測する。

3. 下層(制御層): 具体のロボット本体と組み合わせる。最後の数センチメートルの精度、力の制御、遅延、安全性の問題を解決する。

スタートアップ企業にとっての新たな障壁は「パラメータの規模」ではなく、「データに動作が含まれているか」です。

  • 通常のビデオデータ:モデルに「人間がカップを持ち上げた」と伝える。(汎用モデルはすでに十分に学んでいる)
  • ロボットのインタラクションデータ:ロボットアームがどの方向から近づき、関節がどのように動き、チャックがどれだけの力を加えたか、掴み取りが成功したか、失敗した後にどのように回復したかを記録する。

このような「視覚、触覚、力覚、関節の状態、実行結果」を含むインタラクションデータこそが、ロボットが実世界に入るための真の経験です。このようなデータはインターネットから直接得るのは難しく、計算能力を積み上げても自動的に補うのは難しいです。

簡単に言うと、もう何でも知っている「脳」を作る必要はありません。それはOpenAIの仕事です。あなたがすべきは「身体的経験」を蓄積することです。ロボットに触らせ、掴ませ、失敗させ、修正させるのです。これらの「実際のインタラクションデータ」を持っている企業が次の段階の優位性を持つでしょう。

---

5. 業界の終局:スタートラインは前に移動したが、ゲームはまだ終わっていない

最後に、この記事の結論を見てみましょう。GPT-6は具身知能を終わらせたわけではなく、業界のスタートラインを一歩前に押し進めたのです。

  • 過去: スタートラインは「ロボットに世界を認識させる」ことでした。
  • 現在: スタートラインは「ロボットに安全かつ正確に世界を変えさせる」ことになりました。

もし企業の核心能力がロボットに物品を認識させ、言語を理解させることだけなら、GPT-6との差はどんどん広がり、最終的には周辺化されるでしょう。

しかし、大量の実際のインタラクションデータ、力覚、触覚、失敗のプロセスデータを蓄積している企業なら、GPT-6を「上層の脳」として利用し、自社を不可欠な「身体的実行者」にすることができます。

投資家へのヒント:

  • 警戒: 「汎用ロボットのベースモデルを訓練する」と言いながら、独自の実際のデータを持っていない企業は大きなリスクにさらされています。
  • 有望: 特定のシナリオ(工場、家庭など)に焦点を当て、「展開・実行・失敗・修正・再訓練」のサイクルを形成し、大量の高品質なインタラクションデータを蓄積している企業は有望です。

一言でまとめると:

世界を認識することは汎用能力になりつつありますが、安全かつ正確に世界を変える方法こそが、具身知能企業がこれから証明すべき真の価値です。AIと誰がより多く見るかを競うのではなく、誰がより安定して行動できるかを競うべきです。