虎嗅

ロボットの野球プレーが話題になる真相:目は借りたもので、脳は「偽物」だ

原文:机器人打球刷屏的真相:眼睛是借的,大脑是“假”的

ロボットの野球はカッコいい?「偽の脳」に騙されるな——本当の分水嶺はここにある

皆さん、こんにちは。私は財経ジャーナリストであり経済学者です。最近、短編動画を見たりテクノロジーニュースをチェックしたりすると、「ロボットが卓球をする」動画に目が奪われることが多いでしょう。画面では、ボールが高速で飛び、ロボットが機敏に動き、バットを振り、人間と何百回も対戦するのです。

多くの人が最初に思うのは「すごい、ロボットにもついに「脳」ができた!世界を理解し、動きを捉えられるようになった!」ということでしょう。

しかし今日は、その考えに冷水を浴びせたいと思います。あるいは、その考えに「蓋」をしてしまいたいと思います。

テクノロジー業界を長期にわたって観察してきた者として、かつて百度の自動運転システムのシニアエンジニア(仮名:林知远)の深い洞察をもとに、厳しい真実をお伝えします。これらの高い知能を持つように見える「野球ロボット」は、実際には「盲目」であり、「人形」であり、「偽の脳」の混合物に過ぎないのです。

耳障りな話かもしれませんが、論理は非常に明確です。以下では、この深い報告を5つの側面に分けて、現象の裏にある本質を見極め、ロボットが本当の「知能」にどれだけ近づいているのか、そして未来の真のチャンスはどこにあるのかをお伝えします。

---

一、見せかけの「技術」の裏にある真実:それは「ハック」であり、「内面の力」ではない

まず、なぜロボットがそんなに正確に動けるのかを理解しましょう。

1. 実際には「盲目」だ

ロボットが自分のカメラでボールを見て動いていると思っていますか?違います。

ほとんどのデモンストレーションでは、コートには高精度の外部機器が設置されています。ボールには反射材が塗られ、コートはミリメートル単位で位置が定められています。外部には数百万円もするカメラやセンサーシステムがあり、まるで何十組もの「目」のようにボールをじっと見つめています。

これらの外部機器がリアルタイムでボールの位置、速度、軌道を計算し、ロボットに「ボールが左側に来るからバットを振れ!」と指示します。

これはまるで、目を閉じて運転しているのに、隣にナビゲーターが望遠鏡で「左に曲がれ」「右に曲がれ」と指示しているようなものです。車は確かに正しく曲がりますが、運転している人(ロボット)自身は道を「見て」いないのです。

2. 操作される「人形」だ

この仕組みは技術的には「遠隔操作」の高度な形、あるいは「システムレベルの自動運用」と呼ばれます。

誰もリモコンを操作していないように見えますが、システム全体が自動的に動いています。重要なのは、感知(ボールを見ること)と判断(どのように動くか)はロボット自身ではなく、コートの外にある巨大な機器で行われているということです。

これは自動運転における「高精度マップ」と同じです。以前は高精度マップがすごいと思われていましたが、マップの範囲を超えたり、道路状況が変わったりすると、車は動けなくなります。

ロボットの野球も同じです。反射材のボールや固定された位置、定められたコートがなくなり、見知らぬ環境で光が複雑でマークがないコートで動かされたら、ロボットはおそらく無闇にバットを振るでしょう。

3. 「小脳」は強いが、「脳」は欠如している

もちろん、ロボットが何もできないわけではありません。

「ここを打て」という指示を受けると、体のバランスを調整し、歩幅を決め、バットを振る必要があります。これはロボットの**「小脳」(運動制御能力)が大きく進歩していることを示しています。体は非常に協調的で、反応も速いです。

しかし、「小脳」が強いからといって、「脳」が自律しているわけではありません。

本当の人間が野球をするときは、相手の動きを目で観察し、経験をもとにボールの軌道を予測し、不完全な情報の中で判断を下します。しかし現在のロボットは、外部システムから「標準的な答え」を与えられているのです。

結論: 現在のデモは「運動制御」の能力を示しているだけであり、「認知知能」の能力を示しているわけではありません。

---

二、本当の「脳」の問題:見えるからといって、正しく動いているとは限らない

もしいつか技術が突破し、ロボットが自分のカメラでボールをはっきりと見ることができるようになったとしたら、それで「脳」を持っていると言えるでしょうか?

まだです。なぜなら「見る」ことはただの第一歩に過ぎず、もっと難しいのは「それに基づいて正しく動くこと」だからです。

1. 最も危険な失敗:ロボットが間違えても、それに気づかない

例えば、ロボットがカップをテーブルに置こうとします。カップを掴み、動かし、置きます。動きは完璧に見えます。

しかし、カップが傾いて水がこぼれてしまいます。

実験室では研究者は「ああ、今回はダメだった、やり直せ」と言うかもしれません。

しかし現実世界では、それは事故です。

本当の「脳」は動作だけでなく、その結果も判断できなければなりません。

「今回の動作は合格か?ダメなら何度やり直すか?諦めるか?」と。

現在の多くのロボットは、上司が「カップをテーブルに置け」と命令すればそれを実行するだけです。カップが安定しているかどうかを自分でチェックすることはできません。このような自己チェックの欠如が、ロボットの最大の弱点です。

2. モデルは統合されているが、「責任」は消えない

現在、AIモデルが大きくなるにつれて(例えばVLAモデルのように)、複雑な階層的なシステムや安全チェックが不要になるのではないかという議論があります。

しかし林知远は自動運転の10年間の経験から「そうではない」と言います。

過去10年間で自動運転は独立したモジュール(感知、計画、制御)から大きなモデルへと統合されました。しかし、「ブレーキをかける」「アラームを出す」「故障を処理する」といった機能は消えていません。ただ形が変わっただけです。

モデルは統合されても、責任の境界は消えません。

ユーザーはコードが大きなモデルに書かれているか、10個の小さなモデルに書かれているかは気にしません。ユーザーが気にするのは、ロボットが失敗したときに止まれるか、助けを求められるか、より大きな災害を避けられるかです。

もしモデルが賢くなっても「自分が間違えたことに気づかなければ、それが最大の危険です。

3. 現実世界は「ゆっくり考える」時間を与えてくれない

大きなモデルは賢いですが、考えるのに時間がかかります。

ボールが飛んできたり、アームが壁にぶつかりそうになったりしたとき、現実世界は待ってはくれません。

ですから、未来のロボットには「大脳」と「小脳」の組み合わせが必要です:

  • 大脳(ゆっくり考える):タスクを理解し、戦略を立て、複雑な論理を処理する。
  • 小脳(速く反応する):バランスを保ち、障害物を避け、迅速に動く。

これらの組み合わせが鍵です。今、「VLAモデル」と「世界モデル」のどちらが優れているかを議論するのは早すぎます。重要なのは、どのアーキテクチャがロボットを速くて安定して動かせるかかです。

---

三、成功率に騙されない:本当の生産性の指標は「人間をどれだけ連続して置き換えられるか」

多くの企業はデータを誇示します。「私たちのロボットの把持成功率は99%です!」

素晴らしいように聞こえますが、林知远にとってこの指標は意味がありません。

1. 唯一重要な指標:ロボットが人間の代わりにどれだけ長く働けるか?

一度の動作の成功率だけを見ても、簡単に「素晴らしい」と言えます。最適な光の条件や単純な物体、理想的な距離でテストを行えばそう見えます。

しかし、本当の生産性は、価値のあるタスクで、明確な結果基準がある環境で、ロボットがどれだけ連続して安定して人間の仕事を代替できるかです。

  • 1時間か?1日か?1ヶ月か?
  • その間に何回失敗するか?
  • 失敗した後、どれだけ早く復旧できるか?
  • どれだけ人間の介入が必要か?

この指標はタスクの価値、安定性、異常時の復旧能力、人件費をすべて考慮に入れています。これは不正行為が難しい指標であり、長期的な実力を反映しています。

2. 現実世界こそが最高の「教師」

実験室では研究者が「成功」と定義できます。

しかし工場では、塗装が均一でなければ不合格です。点検でネジを見落とせば事故です。

現実の生産環境は厳しい評価システムを提供しています。

誰か(作業員や品質検査員)が直接「間違っている、やり直せ」と言います。

このようなリアルなフィードバックは実験室ではお金を払っても得られない貴重なデータです。

ですから、ロボットが賢くなるためには実験室で「問題を解く」だけでなく、実際の現場で「試練に耐える」必要があります。試練を経てこそ、どこが痛いのかを知り、本当に進化できるのです。

---

四、60点を超えたら、モデルではなく「データの質」と「汎化能力」が重要になる

業界には「ロボットが60点に達するまではモデルとデータに頼り、60点を超えたらエンジニアリングに頼る」という言い方があります。

林知远は完全には同意しません。彼にとって、60点を超えてもデータの競争は続くが、データの要求は変わると考えています。

1. 「動く」から「信頼できる」へ、データの基準が向上する

60点の段階では、ロボットが時々間違えても問題ありません。動ければいいのです。

しかし生産現場では基準が非常に厳しいです。必要なデータはもはや単純な「画像+動作」ではありません。

  • タスクの結果:最終的に目的が達成されたか?
  • 失敗の原因:どのステップで間違えたのか?
  • 復旧策:間違えた後、どのように対処したか?
  • 最終状態:復旧後に成功したか?

「4回失敗して5回目に成功した」としても、「自己進化」とは言えません。

本当の学習には、以下のことを検証する必要があります:

  • 時間の経過:今日学んだことを明日も覚えているか?
  • 異なるシナリオへの汎化:トイレの掃除ができたからといって、別の色や形のトイレでもできるか?
  • 異なるロボットへの汎化:このロボットが一つのタスクで学んだことを別のロボットにも応用できるか?

ロボットが一つのタスクから少量のデータで別のタスクに移行できるかどうかが、本当の能力を示しています。

2. ロボットには自動車のような「データの恩恵」はない

自動車は売られた後、何百万人もの所有者が毎日道路を走り、企業に大量のデータを無料で提供します。

しかしロボットはどうでしょうか?誰が20万円を払ってロボットを買い、企業のためにデータを収集してくれるでしょうか?

ですから、ロボット企業は「ユーザーが使いながらデータを収集する」ことを期待できません。

より現実的な方法は:

1. まずシミュレーター(Sim)と基本的なモデルでほとんどの能力を訓練する。

2. ロボットを実際の環境に投入する。

3. シミュレーションと現実の不一致がある場所で、その部分のデータを補