虎嗅

【解体!具身インテリジェンスの100万時間の実験:本当に「賢い」ロボットを作り出せるのか?|AI 100閉門会】

原文:拆透具身智能100万小时:真能喂出一个“聪明”机器人吗?|AI 100闭门会

核心内容の要約

具身知能(物理世界と相互作用できるロボットAI)の分野は盛り上がっていますが、業界内では「数百万時間分のデータさえあればGPTのような成果が得られる」という考え方に誤解があります。実際には、データの有効性(情報量、難しいケースのカバー範囲、汎用性)の方が規模よりも重要です。現在、業界は「データを大量に集める」から「効率を上げる」へと方向転換しており、実用化は工業や商業サービス向けのシナリオが優先されています(人型ロボットよりも車輪付きロボットの方が実用的です)。モデルのアプローチとしては、VLA(Video-Learning-Agents)とワールドモデルのどちらを選ぶかは短期的には必須ではありません。データ企業の競争力は、「データ収集→トレーニング→実装→失敗からのフィードバック」というサイクルにあり、単なるデータ量そのものではありません。中国とアメリカに大きな差はなく、中国はサプライチェーンやハードウェアの面で優位性を持っています。

詳細な分析

1. 数百万時間はただの宣伝文句か?有効なデータこそが本当に重要

多くの人が具身知能には「数百万時間分のデータ」が必要だと言いますが、クーワテクノロジーの彭湃は逆説的な例を挙げています。通常の道路で100キロメートル走ってもモデルはあまり学べませんが、市場で飛ぶプラスチック袋はレーザーレーダーやビジョンシステムの柔軟な障害物認識能力の違いを明らかにします。これが「情報の価値」の違いです。

重要なポイント:

  • データの信頼性:多くの「数百万時間分のデータ」は言語モデルのトークン量から計算されたもので、検証も反証もできません。
  • 有効なデータを判断するには3つの指標があります:①説明可能性(失敗原因を角度・力・戦略などで特定できること)、②難しいケースの割合(豪雨や車と人の混在など、頻繁には起きないがエラーが発生しやすいシナリオ)、③異なるロボット間でのデータの再利用可能性。
  • 「データを大量に集める」ことをやめる基準:新たに得られるデータのビジネス価値が収集コストを下回る場合(経済学的な転換点)。例えば、あるシナリオで99%の成功率が達成されたら、さらにデータを集める意味はありません。

2. データの構造が変わった:人間の動画を基盤とし、実際の難しいケースを重要視

具身知能のトレーニングに使用されるデータの構造は固定ではなく、現在は動的なピラミッド状になっています:

  • 基底層:人間が撮影した第一人称の動画(料理や掃除の動画など)——規模が大きく、異なるロボット間での汎用性が高い。
  • 中間層:シミュレーションや合成されたデータ——極端な状況(原子力発電所の故障など)を再現し、実際には収集が困難な失敗例を補う。
  • 頂点層:実際の運用で発生した難しいケース——最も価値があり、モデルの安定性を直接向上させる。

核心的な論理:これら3つの層は循環して使用されます(例えば、実際にプラスチック袋の問題に遭遇した場合、シミュレーションで再現し、人間の動画で類似の状況を補う)。千尋インテリジェントの郭俊良によると、純粋な人間の動画だけではロボットの相互作用の詳細が欠けているため、UMI(User-Machine Interface)デバイス(ハンドル付きクランプなど)のデータも中間層に加えられます。

3. モデルのアプローチ:VLAとワールドモデル、短期的には二者択一の必要はない

業界には2つのアプローチがあります:VLA(動画から直接動作を学ぶ)とワールドモデル(物理法則を学んだ後で意思決定する)。専門家たちは以下のように考えています:

  • データ量が十分な場合、差はほとんどない:千尋の実験では、データ量が一定レベルに達すると2つのアプローチの効果に大きな違いはない。
  • 階層的なシステムの方が実用的:Google Gemini Roboticsがその例です。高層モデルがタスクを理解し(例えば「掃除」)、低層のVLAが実行を担当します(例えば「回転してブラシを動かす」)。SLAMなどの既存の機能も直接利用できる。
  • 商業シナリオでは「一つのモデルで全てをこなす必要はない:光輪インテリジェントの廉和によると、多くの顧客はロボットが特定のタスクを安定してこなせればよく、一つのモデルで全てを行う必要はない。

4. 商業化:まずは「中間層」から実用化を始める、人型ロボットは必須ではない

以前の自動化は「環境を改造してロボットに適応させる」(例えば閉鎖的な商業施設での掃除ロボット)が主流でしたが、現在の具身知能は「ロボットが人間社会に適応する」ことが求められています(例えば歩行者天国の清掃ロボット)。

実用化の優先順位:

  • 极端なケースを除外する:①高度にカスタマイズされた工業シナリオ(従来の自動化が成熟しており、利益が低い)、②家庭環境(複雑で高齢者や子供、ペットがいるため短期間では収益が見込めない)。
  • 中間層を選ぶ:工業や商業サービス向けのシナリオ(例えば工場での物の運搬や商業施設の清掃)——カスタマイズが必要だが汎用性も求められ、人間との相互作用は頻繁ではない。
  • 人型ロボットは必須ではない:千尋インテリジェントの郭俊良によると、車輪付きのシャーシに昇降機構を加えるだけで現在のタスクの95%以上をカバーできる。顧客が気にするのは「安定して動作するか、メンテナンスコストが低いか、ROIが良いか」であり、ロボットが人間に似ているかどうかではない。

5. データ企業の生き残り方:規模よりもサイクルの重要性

データ企業の競争力は「どれだけ多くのデータを収集できるか」ではなく、「失敗からどれだけ効果的に学べるか」です:

  • サイクルが重要:データ収集→選別→トレーニング→実装→失敗からのフィードバック→再トレーニングというサイクルが企業の競争力になる。例えば、ロボットが道路でプラスチック袋に詰まった場合、その失敗データを記録してモデルが次回同じミスをしないようにする。
  • データの汎用性:刻行時空の郑宇靖によると、データは特定のロボットに縛られず、異なるロボット間で再利用可能でなければならない(例えばクランプを交換しても古いデータが使えるように)。
  • モデルチームとの連携:光輪インテリジェントの廉和によると、データ企業は単にファイルを提供するだけでなく、モデルが何を必要としているかを理解し、新たな情報を含むデータを提供する必要がある(例えば繰り返される一般的なシナリオのデータは役に立たないが、難しいケースのデータは重要)。

結論

具身知能の競争は「どれだけ多くのデータを持っているか」から「どれだけ効率的か」へと移行しています。数百万時間分のデータはあくまで出発点に過ぎず、本当の分岐点は、「実世界で発生する貴重な失敗例をモデルが学び、次回同じミスをしないようにすること」です。一般ユーザーにとって、将来登場するロボットは必ずしも人型ではないかもしれませんが、より賢くなるでしょう。市場でプラスチック袋を避けたり、歩行者天国で配達車を避けたりして、私たちの生活に真に融合するのです。