核心内容の要約
2026年、具身知能(人間のように環境を認識し、動作することができるロボットの分野)は非常に盛り上がっており、前7ヶ月だけでの資金調達額は750億円を超えました(2025年全年の4倍、2024年の22倍)。業界の展示会も多数開催されており(世界ロボット大会には300社が参加し、2000点の製品が展示される予定)、データを提供する企業でさえも「金を掘る」企業よりも早く資金を調達しています(25のデータ企業が半年間で170億円を調達)。しかし、業界にとって最も重要な課題はデータの量ではなく、「有効な鍵となるデータ」です。つまり、どのようなデータがロボットの能力を実際に向上させ、異なるシナリオで再利用できるかを判断するための統一された基準がないのです。このため、主催者はデータの全プロセスをカバーする4人の専門家を招き、「何が具身知能にとって高価値な資産か」というテーマで議論を行い、関係者が参加できる閉じたライブ配信を開催しました。
詳細な分析
1. 「具身知能は今どれほど注目されているのか?資金と熱意が溢れ出しそうだ」
- 資金調達額の急増:2026年の前7ヶ月で、具身知能分野の資金調達額は750億円を突破しました。これは2025年全年の4倍にあたり、2024年全年の22倍です。つまり、2年前の1年間で稼いだ資金がわずか7ヶ月で集まったということで、資本が熱狂的に流入しています。
- 業界の盛り上がり:ちょうど終わった世界人工知能大会(WAIC)の熱気も冷めやらず、世界ロボット大会が開催されます。300社が2000点のロボット製品を持って参加し、まるで「ロボットの祭り」のような賑わいです。
- データ提供企業が先に資金を調達:データの収集や処理を行う企業は、ロボットを直接開発する企業よりも早く資金を得ています。25のデータ企業が半年間で170億円を調達したことから、「データ」が業界にとって不可欠な要素であることがわかります。
2. 「なぜ「有効なデータ」が大きな問題になっているのか?」
現在、業界では「100万時間」という指標が注目されていますが、大きな誤解があります。つまり、「データの収集時間」=「有効なトレーニングデータ」とは限りません。例えば、100万時間分のロボットの動作ビデオを収集しても、実際にトレーニングに使用できるのはそのうちのわずか10万時間だけかもしれません(残りは重複したり無駄になったりする)。
業界が必要としているのは「より多くのデータ」ではなく、統一された「有効なデータ基準」です。
- このデータがロボットの能力を向上させるか?(例えば、自動運転の安定性を高める)
- 異なるシナリオやロボット間で再利用できるか?(例えば、掃除ロボットの障害物回避データを工業用ロボットに応用できるか)
- 長期にわたって投資する価値があるか?(一度使用したらすぐに古くならないか)
この基準がなければ、どれだけデータがあっても「ゴミ」に過ぎません。そのため、「有効なデータ」が業界の最大の課題となっています。
3. **4人の専門家が4つの観点からデータの価値を解説**
今回招かれた4人の専門家は、具身知能データの全プロセスをカバーしており、それぞれ異なる問題に対する答えを提供します:
- 彭湃(酷哇科技):失敗したデータの方が価値がある
自動運転ロボットの開発に携わっており、日常的に「事故」のシナリオに直面しています。彼は、「なぜ事故が起きたのか」を明確に示すトラックデータの方が、100点のスムーズな動作データよりも有用だと指摘します。なぜなら、失敗から学ぶことでロボットは次回同じ過ちを避けることができるからです。
- 郭俊良(千寻智能):データの質がモデルの限界を決める
モデルの事前トレーニングを担当しており、さまざまなデータソース(人間のビデオ、実際のロボットの動作、シミュレーション生成、失敗からのフィードバックデータ)の効果を研究しています。例えば、人間のビデオはロボットに「意味」を教え(「ドアを開ける」という行動の意味を理解させる)、実際のロボットの動作は「細かい動き」を教えます。予算が限られている場合、データの量を増やすべきか、質を優先すべきか?
- 廉和(光轮智能):データは閉じたループ内でなければ意味がない
データの収集、シミュレーション、評価を担当しています。人間のデータ(例えば料理の方法)+シミュレーションデータ(コンピュータでの料理シミュレーション)+実際のデータ(ロボットによる料理)が閉じたループを形成することで、モデルの精度を高めることができます。また、データが本当にロボットの能力を向上させているかどうかを評価する方法も説明します。
- 郑宇靖(刻行时空):データは3つの要件を満たして初めて使用できる
実際のデータの生成に携わっており、データを収集しただけでは十分ではないと指摘します。形式の統一、品質の確保、著作権の遵守などが必要です。異なるロボット(例えば掃除ロボットと工業用ロボット)のデータをどのように管理するかも重要です。
4. **業界が最も関心を持っている3つの「本当の問題」**
今回の議論では直接的に3つの核心的な問題に取り組みます:
- データはどこから得られるのか?予算はどのように分配するのか?
4種類のデータソース(人間の視点からのビデオ、遠隔操作によるロボットの動作、シミュレーション生成、失敗からのフィードバックデータ)がそれぞれどのような問題を解決するのか?予算が1億円しかない場合、シミュレーション生成に多くを割り当てるべきか、失敗からのフィードバックデータに多くを割り当てるべきか?
- 100万時間分のデータのうち、実際にトレーニングに使用できるのはどれだけか?
1時間分のデータから、実際にトレーニングセットに使用できるのは数分だけです。なぜ不要なデータが生じるのか?コストは「収集時間」に基づいて計算すべきか、それとも「有効なデータ量」や「難しいケースの割合」に基づいて計算すべきか?
- データは壁になるのか、公共の資産になるのか?
ロボットを変更する場合(例えば掃除ロボットから配達ロボットに)、以前のデータはまだ使用できるのか?データの所有権は誰にあるのか(発注者、ロボットメーカー、モデル開発会社、データサービスプロバイダー)?もし売却可能なら、それは企業の強みになり得るのか?
5. **このライブ配信は誰に適しているのか?どのようなメリットがあるのか?**
- 対象者:
具身知能モデル、ロボット本体、データ収集/シミュレーションを行う起業家や技術者;ロボット、AIハードウェア、スマート製造の関係者;テクノロジー投資家、研究者、メディア。
- 得られるメリット:
① 第一线の専門家たちの共通認識:どのようなデータが本当にロボットの能力を向上させるか
② コストの明確化:どれだけの時間を費やせば有効なデータを得られるか
③ データの範囲の理解:データの所有権は誰にあるのか、再利用や取引が可能か
④ 資源の接続:モデル開発会社、ロボットメーカー、投資家とのネットワーク構築
ライブ配信は8月17日19:00~21:00に行われ、腾讯会议(テンセントミーティング)の閉じた形式で開催されます。興味がある方はQRコードをスキャンして登録してください。