虎嗅

中国の新興企業がわずか3ヶ月でユニコーン企業に成長

原文:具身新贵,3个月成为独角兽

ロボット業界における「水を売る人」が注目を集める:ロボットを製造しない会社がなぜ10億ドル以上の評価額を誇るのか?

皆さん、こんにちは。私は財経ジャーナリストです。今日は少し直感に反するニュースについてお話しします。皆が「人型ロボット」の本体や「大規模なモデル」に注目している中、ロボットにデータを提供する会社がわずか3ヶ月で評価額を12億ドル(約85億円以上)にまで押し上げました。この評価額には今後の予測や為替変動も含まれている可能性がありますが、とりあえずはその高い評価額に基づいてその人気を考えてみましょう。

この会社の名前はXDOFです。XDOFはロボットを製造したり、核心的なアルゴリズムを開発したりはしません。彼らが行うのは、ロボットが作業する際のビデオや動作データを収集・整理・処理するという、一見地味な仕事です。

なぜ資本はこれほど熱狂するのでしょうか?その背後には「エンボディドAI(Embodied AI)」業界の大きな転換があります。以下では、この事象を5つの側面から分かりやすく説明します。

---

1. 核心情報:3ヶ月で2回の資金調達を経て、「無名」から「ユニコーン」へ

何が起こったのか?

XDOFは2024年に設立され、創業チームはバークレー大学(世界有数のロボット研究機関)出身です。今年の6月に7000万ドル(Aラウンド)の資金調達を行い、そのわずか3ヶ月後の9月には新たなラウンドの資金調達が発表され、評価額は12億ドルに達しました。

なぜこんなに早いのか?

通常、スタートアップの資金調達は「年単位」で行われますが、XDOFは「四半期」や「月単位」で進んでいます。これは市場が非常に熱心であることを示しています。

  • 著名な投資家の支援:a16z(アンダーソン・ホロウィッツ・ファンド)やThrive Capitalなどの大手投資家が投資しています。これらの機関は通常、最も確実性の高い分野にのみ投資します。
  • 驚異的な収益:会社はまだ設立から2年も経っていませんが、年間収益はすでに5000万ドルに近づいています。これは非常に優れた収益能力であり、単なるプレゼンテーションによる話ではなく、実際に製品を販売していることを証明しています。また、顧客も喜んで支払っているのです。

一言でまとめると:エンボディドAI分野では、「データ」が以前は単なる雑用と思われていましたが、今では最も収益性が高く、最も希少な「硬貨」となっています。

---

2. チームの背景:バークレー大学の優秀な学生たちとMetaの経験を持つ彼らがなぜ成功したのか?

創業者は誰か?

XDOFの3人の創業者(Philipp Wu、Fred Shentu、Nemo Jin)は普通のプログラマーではありません。彼らは「専門的な訓練を受けた」トップレベルの研究者です。

  • Philipp Wu(中核メンバー):バークレー大学のロボット学習ラボ出身で、Pieter Abbeelの指導を受けています。
  • Abbeelについて:彼はロボット学習の分野の権威であり、ロボットが人間のように「見たり試行錯誤を通じて」服の折り方や結び方を学ぶ方法を研究しています。
  • Wuの経歴:バークレー大学での研究だけでなく、Meta(Facebookの親会社)でも訪問研究者として働き、マルチモーダルロボットの基礎モデルを研究していました。また、Covariant(物流ロボットを開発する有名企業)でも働いていました。
  • 技術的基盤:彼らの核心技術の一つはバークレー大学が開発したGELLO遠隔操作システムです。このシステムを使えば、人間がハンドルを通じてロボットを遠隔操作し、ロボットの微細な動きを記録することができます。

背景が重要な理由

AI業界では、「データを理解している者がモデルも理解している」と言われています。XDOFのチームはデータのアノテーションを行う素人ではなく、ロボットがどのように「考え」、「動く」かを最もよく理解している人々です。彼らはロボットのトレーニングにおいて、どのデータが「無価値」で、どのデータが「貴重」かを知っています。このような技術的な壁は、単なるデータアウトソーシング会社(ラベル付けを行うだけの会社)には比べ物になりません。

---

3. 事業の本質:単なるビデオ撮影ではなく、ロボットの「リハビリトレーニング」を行う

多くの人が誤解している:XDOFはただ人を雇ってロボットの作業を撮影し、そのビデオをAI会社に売っているだけだと思っています。

実際には:それはビデオ撮影よりもはるかに複雑な作業です。

なぜ単にビデオを撮るだけではいけないのか?

  • インターネットデータと物理世界のデータ:
  • ChatGPT(テキストベースの大規模モデル)のトレーニングには、インターネット上にある記事やコードがデータとして利用されます。
  • ロボット(エンボディドAI)のトレーニングには、物理的な相互作用が必要です。ロボットがカップを掴むとき、しっかりと掴めているか?力の加減は?指の角度は?もし滑ってしまったら、それは摩擦力が不足しているのか、角度が悪いのか?
  • これらの「失敗」や「調整」のプロセスこそが最も価値のあるトレーニング材料です。

XDOFが何をしているのか?

彼らが提供するのは「高品質なデータパイプラインです。

  • 同期記録:ビデオだけでなく、ロボットの関節角度、モーターの力、触覚フィードバックなども同時に記録します。
  • データのクリーニング:例えば、彼らが開発したWARP-RM技術では、デモンストレーションを行う人が一瞬ためらったり停止したりすると、ロボットも同じように「ためらう」ことを学び、効率が低下します。XDOFの技術により、どの動作が実際にタスクを進めているのか、どれが無駄な停止なのかを識別し、データを「加速」または「重み付け」することで、ロボットがより速く、より正確に学ぶことができます。
  • 結果:同じ服の折り方を学ぶ場合でも、XDOFの処理を経たデータを使用すると、ロボットの平均所要時間は114秒から64秒に短縮され、成功率も向上します。

一言でまとめると:XDOFが売っているのは「ビデオ」ではなく、「ロボットの知能を直接向上させるための精製されたデータ」です。

---

4. 業界の類推:ロボット業界の「Scale AI」だが、より難しく、より価値がある

なぜ「ロボット業界のScale AI」と呼ばれるのか?

  • Scale AIはChatGPTやSoraなどのAIモデルをトレーニングするためのデータを提供する大手企業です。それ自体はモデルを開発しませんが、モデルに必要なデータを供給します。Scale AIがなければ、OpenAIのモデルはうまく機能しません。
  • XDOFも同じ役割を果たしています。ロボット本体を製造する企業(例:テスラのOptimus、Figure)や大規模なモデルを開発する企業(例:NVIDIA、Google)は、大量で高品質な実世界の相互作用データが必要です。

違いは何か?

  • Scale AIが扱うのはデジタル世界のデータ(画像、テキスト)で、比較的自動化が容易です。
  • XDOFが扱うのは物理世界のデータです。物理世界は複雑で予測不可能です。カップは傾いていたり、光の具合が変わったり、布地がしわくちゃになっていたりすることがあります。
  • そのため、XDOFの競争障壁はより高い:GELLOシステムのような高度なハードウェアや、より専門的なアルゴリズム、物理法則に対する深い理解が必要です。

ビジネスロジック:

  • 初期:データセット(ABC-130K、13万件のトラック)を販売します。
  • 中期:データ収集システムやアノテーションプラットフォームを販売します。
  • 長期的には:インフラストラクチャープラットフォームとなります。クラウドコンピューティングがインターネットにとってそうであるように、XDOFはロボットトレーニングのためのインフラとなることを目指しています。すべてのロボット企業は彼らのデータパイプラインに依存してモデルを進化させていきます。

一言でまとめると:もしロボットが未来のiPhoneであるならば、XDOFはその核心的なチップ製造の品質データを提供する重要な供給者です。

---

5. 未来の展望:データビジネスの「天井」はどこにあるのか?

国内でも競争が激化している

記事によると、国内にもXDOFのような会社があります(例:光輪智能、觅蜂科技)。これは世界中で「高品質なデータを掌握している者がエンボディドAIの命脈を握っている」という認識が広まっていることを示しています。

データビジネスの上限

多くの人が心配しています:データビジネスは単なる人件費集約型のアウトソーシングなのでしょうか?儲かるのは大変な仕事なのでしょうか?

XDOFのモデルはこの偏見を打ち破りました:

1. 一回限りの取引ではない:モデルは継続的にトレーニングが必要であり、データも継続的に更新が必要です。今日は服の折り方を学び、明日は皿洗いを学び、明後日は運転を学ぶ必要があります。データの需要は無限に増加しています。

2. 「データの販売」から「データの生成方法の販売」へ:XDOFはデータだけでなく、「データを効率的に生成するためのツールやシステム」も販売しています。これは石油会社が石油だけでなく、掘削技術や精製所も販売するのと同じです。

3. 品質が上限を決定する:AI業界には「Garbage in, garbage out(悪いデータが入れば、悪い結果が出る)」という言葉があります。データの品質が悪ければ、どんなに優れたモデルもうまく機能しません。XDOFの核心的な価値は、「良いデータ」を提供することです。

リスクについて

  • 技術的な進路が不確か:現在、ロボット業界はまだ探索段階にあります。将来的に「シミュレーションデータ」(コンピュータ上での仮想データ)が「実際のデータ」よりも安価で効果的であることが判明した場合、XDOFのビジネスモデルは影響を受ける可能性があります。
  • 競争が激しい:NVIDIAやテスラのような大手企業が自社のデータチームを構築し、第三者のデータ会社の市場を圧迫する可能性があります。

最終的な結論

XDOFの台頭は、エンボディドAI業界が「ハードウェアやコンセプトの競争」から「データや実用性の競争」へと移行していることを示しています。

一般の人々にとっては、これは以下を意味します:

  • 未来のロボットの進歩は、エンジニアがコードを書くだけでなく、実験室や工場でロボットを遠隔操作し、微細な動きを記録する「データワーカーやその背後にあるアルゴリズムシステム」によってもたらされるでしょう。
  • 投資の観点から見ると、「シャベルを売る」ビジネス(データインフラ)は、「金を掘る」ビジネス(ロボット本体)よりも安定しており、早期に大きな利益をもたらす可能性があります。

XDOFの例からわかるように、AI時代においてはデータは単なる副産物ではなく、核心的な資産です。そして、これらの資産を正確に精製できる人々が新たな富の創造者になりつつあります。