虎嗅

**伝統的な制御手法からRL(強化学習)、そして大規模モデルまで:私が見る「具身知能」は詐欺ではない**

原文:从传统控制、RL 到大模型:我眼中的具身智能不是骗局

核心内容の要約

「具身知能」とは、人間のように世界を認識し、行動し、理解することができるロボットのことです。これは単なる資本の煽りによる詐欺ではなく、ロボット分野における実際の「パラダイムシフト」(アプローチの変化)ですが、まだ大規模に実用化されている段階には至っていません。具身知能は3つの主要な技術(従来の制御技術、強化学習、大規模なAIモデル)に支えられており、中国の産業基盤(巨大なロボット市場、完全なサプライチェーン、政策的な支援)も備えています。しかし、短期的には実用性に欠ける点も多く(多くのデモンストレーションが実用的ではない)、長期的にはコストや信頼性といった課題を解決する必要があります。

1. 技術的側面:3つの要素が新しいアプローチを生み出す

具身知能の進歩は、単一の技術によるものではなく、従来の制御技術、強化学習、大規模なAIモデルの組み合わせによるものです:

  • 従来の制御技術は機能しなくなったわけではないが、もはや十分ではない:以前のロボット(例えば工業用のアーム)は「固定された動作」のみを実行でき、複雑な環境(例えば砂利道を歩く脚や手先の操作)には対応できませんでした。
  • 強化学習によりロボットは「自らスキルを学ぶ:エンジニアが動作手順を設定するのではなく、ロボットが仮想環境で何度も試行錯誤を繰り返し(例えば1万回転んでから立ち上がることを学ぶ)、報酬システムを通じて自ら動作戦略を導き出します。これにより、四足歩行ロボットが複雑な地形に適応するなど、人間の手では不可能なことが可能になります。
  • 大規模なAIモデルにより「タスクの理解」が向上:以前のロボットは「命令に従う」だけでしたが、今では「意図を理解」するようになりました。例えば「釘を打つための道具を取ってきて」と言われると、単に「ハンマー」を探すのではなく、「釘を打つ」という機能を理解し、ドライバーや石を探すようになります。大規模なAIモデル(GPTなど)により、ロボットは人間の言葉を理解し、タスクの文脈を把握するようになり、「動作をする」だけでなく「タスクを完了する」ことができるようになります。

2. 中国の産業基盤:基盤はあるが、汎用性にはまだ距離がある

中国はロボット分野で強い基盤を持っていますが、それだけで具身知能が成熟したとは言えません:

  • 工業用ロボットはすでに実際に活用されている:2024年には中国の工業用ロボットの導入量が世界の54%を占め、国内メーカーのシェアが初めて外国メーカーを上回り(57%)、2025年の生産量は前年比で28%増加しました。これらのロボットは主に工場の自動化に使用され、製造業のアップグレードに不可欠です。
  • ヒューマノイドロボットはまだ「パイロット段階」にある:2025年の世界のヒューマノイドロボットの出荷台数は1.8万台で、収入は4億4000万ドルでした。数字は小さいですが、実験室での試作から商業的なパイロットプロジェクト(例えばパフォーマンス、教育、ガイド)へと進んだことを示しています。
  • 政策は推進されているが、問題も存在する:中国政府は2025年までに製造業におけるロボットの密度を倍増させる目標を掲げていますが、ヒューマノイドロボットは「脳、小脳、四肢」の技術を突破する必要があります。現在の150社以上のヒューマノイドロボット関連企業の半数はスタートアップや異業種からの参入であり、研究開発の重複や製品の競合が問題となっています。

3. 短期的な課題:多くのデモンストレーションは実用性に欠ける

現在の具身知能はまだ収益を上げる段階にはありません。主な問題は以下の通りです:

  • 使用シナリオが限られている:ヒューマノイドロボットの85%はパフォーマンス、教育、ガイドなどの「展示的な」用途に使われており、工場や倉庫、介護などの実用的な場面で安定して動作するものは非常に少ない。
  • 技術的な課題が解決されていない:長期的に収益を上げるためには、ロボットがどれくらい連続して動作できるか、故障率はどの程度か、メンテナンスコストはどれほどか、安全責任はどのように扱うかといった問題を解決する必要があります。これらはデモンストレーションビデオでは解決できません。
  • バブルのリスク:多くの企業が資金調達のために魅力的なプレゼンテーションを行っていますが、製品の重複が多く、研究開発リソースが無駄になっています。国家発展改革委員会もこのようなリスクに注意を促しています。

4. 長期的な機会:「踊れるロボット」ではなく、「システム能力」が重要

具身知能の未来は、どの企業が最も優れたロボットを開発するかではなく、技術、ハードウェア、シナリオを実際に統合できるかにかかっています:

  • 技術の統合が必要:従来の制御技術(信頼性のある動作)、強化学習(スキルの習得)、大規模なAIモデル(タスクの理解)の3つが不可欠です。例えば、荷物を運ぶロボットは、「倉庫に箱を運ぶ」という指示を理解し(大規模なAIモデル)、ルートを計画し(強化学習)、そして正確に箱を掴む(従来の制御技術)必要があります。
  • 実用的なシナリオの確立:実際の収益を生み出すシナリオを見つける必要があります。例えば工場での物資の運搬や介護施設での介護など、高いコストを受け入れることができるニーズがある分野です。
  • 従事者にとっての機会:従来の制御技術を理解している人は、強化学習と大規模なAIモデルを組み合わせることで、具身知能の核心的な能力をより迅速に習得できます。制御技術はロボットにとって「基本」であり、それがなければどんなに賢いAIでも動けません。

まとめ

具身知能は詐欺ではなく、技術と産業基盤が実際に存在しています。しかし、短期的には多くの課題があり、すぐに世界を変えることはできません。これは5〜10年を要する革命的な変化であり、最終的に勝利するのは技術、ハードウェア、シナリオを統合できる企業です。一般の人々にとっては、急いで追い求めたり否定したりする必要はありません。これは未来の技術ですが、まだ時間が必要です。従事者にとっては良い時代であり、3つの技術が交差することで、変革とイノベーションの機会が生まれています。