第一财经

【ランニングはただの入場券、ロボットの次なる戦略は?】

原文:跑步只是入场券,机器人下一步拼什么?

核要内容のまとめ

このニュースは、ヒューマノイドロボットとエンボディドインテリジェンスの現状に焦点を当てています。現在のロボットの製造速度(15分で1台)や動作学習の速度(12時間で走ることを学ぶ)は大幅に向上していますが、知能レベルはまだ十分ではありません。エンボディドインテリジェンスが「GPTの瞬間」(ChatGPTのような能力の爆発的な向上)に達するにはまだ距離があり、主なボトルネックはデータ、モデル、計算能力の不足です。また、業界内には技術的なアプローチが分散しており、標準が統一されていないという問題があります。現在、2つの発展の方向性があります——データと計算能力の蓄積と動作の目的の理解です。大規模な展開には、オープンソース化、標準化、商業化といった課題を解決する必要があり、異なるシナリオによっては3〜8年かかると予想されています。

1. 製造速度と動作学習の速さはあるが、知能はまだ遠い

現在のヒューマノイドロボットの「ハードウェアの速度」は驚くべきものです。20年以上前には1台を製造するのに5年かかりましたが、今では展示会場の近くの工場では15分で完成します。走ることを学ぶのも12時間しかかかりません。しかし、これらはすべて「表面的なもの」に過ぎません。ロボットは人間の動作を模倣するだけで、なぜその動作をするのかを理解していません。例えば、パンを切る場合、人によって異なる方法がありますが、ロボットはその動作をそのまま再現するだけで、最終的にサンドイッチを作るためなのかを知りません。このような「模倣型の学習」は業界の発展を加速していますが、大規模に拡張することはできません(例えば、タスクが変わると再学習が必要になるため)。したがって、知能レベルは「動作をすることができる」段階に留まっており、「目的を考える」段階には至っていません。

2. エンボディドインテリジェンスはなぜGPTの瞬間を迎えられないのか?3つのボトルネックとデータの問題

皆が疑問に思っています:エンボディドインテリジェンスはいつChatGPTのように突然進化するのでしょうか?答えはまだ先です。主な問題は3つあります:

1. モデルが小さい:現在のエンボディドインテリジェンスモデルの「知識量」(パラメータの規模)は約70億個ですが、初期のGPTは数千億個に達しており、10倍以上も差があります。

2. 計算能力が不足している:エンボディドモデルのトレーニングには数十枚、場合によっては数枚のGPUで十分ですが、GPTには何万枚ものGPUが必要です。

3. データが不足している:言語モデルはインターネット上のテキストデータを直接使用できますが、ロボットには物理世界のデータ(例えば、アームが柔らかいものを掴む、異なる光の条件に適応するなど)が必要です。これらのデータは簡単には入手できず、収集コストが高く、カバー範囲も限られています(例えば、極端な天候のシナリオなど)。

専門家によると、エンボディドインテリジェンスは言語モデルよりも少なくとも5年遅れており、十分なデータ、大規模なモデル、計算能力がなければGPTの瞬間は来ないでしょう。

3. 2つのアプローチの対立:データと計算能力の蓄積 vs 目的の理解

ボトルネックに直面して、業界は2つのグループに分かれています:

一方は「規模の拡大」:データ、モデル、計算能力をさらに増やすことです。例えば、「合成データ」(GPUを使用してトンネル内の急な光変化などの極端なシナリオをシミュレートする)を用いて実際のデータの不足を補い、モデルのパラメータを拡大し、GPTのように「能力が自然に発現する」ことを期待しています。

もう一方は「目的の理解」:データを無闇に増やすのではなく、ロボットに動作の背後にある目的を理解させることです。例えば、Gordon Chengのチームのロボットは、人間がパンを切るのを観察した後、具体的な動作を学ぶのではなく、「パンを切るのはサンドイッチを作るためだ」と理解します。このアプローチでは多くの動作を学ぶ必要がなく、能力を「圧縮パッケージ」として他のロボットに提供することができ、データと時間を節約できます。

4. 大規模な展開の障害:標準の統一と研究の重複

技術的な突破があっても、ロボットが工場や家庭に普及するには、「それぞれが別々に動いている」という問題を解決する必要があります:

  • 技術的なアプローチの混乱:異なる企業のハードウェアやソフトウェアが互換性がなく、同じ問題を何度も解決する必要があります。
  • データの孤島:各企業のデータフォーマットが異なり、共有できないため、リソースが無駄になります。
  • 商業化の難しさ:多くのロボットはまだ「試作機の展示」段階に留まっており、長期間の運用が難しく、コストが高く、カスタマイズが強すぎて大量生産ができません。

そのため、業界では「オープンソース化と標準化」に取り組み始めています。例えば、ヒューマノイドロボットのオープンソースコミュニティを設立し、オペレーティングシステムやアルゴリズムなどの技術基盤を公開し、共通の標準を使用して研究の重複を減らしています。

5. 大規模な展開にはまだどれくらいかかるのか?シナリオによって異なる

専門家の見解にはばらつきがありますが、シナリオ別に見ると:

  • 半構造化された工場(例えば、固定されたプロセスがあるが時折変化する作業場):3〜5年で大規模に展開できるでしょう。シナリオが比較的コントロール可能であり、ロボットはまずタスクを「8割程度うまくこなし、徐々に最適化できるからです。
  • 工業や家庭:工業では5〜8年、家庭ではさらに時間がかかります(5〜8年)。家庭のシナリオは複雑で(倫理、安全、ロングテール問題などが多いため)。
  • チップ vs ソフトウェア:チップは3〜5年で適切な性能とコストを達成できますが、ソフトウェアエコシステムの成熟にはさらに時間が必要です。

要するに、ロボットが研究室から実世界に進出するには、システムの協調や標準の統一といった「目に見えない問題」を解決する必要があります。単に走る速度やジャンプの高さといった表面的な指標だけを見ているわけにはいきません。

このニュースからわかるのは、ヒューマノイドロボットの「ハードウェアの速度」はすでに速いですが、将来の突破口は「知能の深さ」と「産業の協調」にあるということです。家庭に料理や掃除ができるロボットがいる日はいつ来るのでしょうか?数年は待たなければならないかもしれませんが、方向性は徐々に明確になってきています。