第一财经

抢滩世界模型,具身智能的下一场淘汰赛

该文章尚未提供 Русский 解读,以下为中文版内容。

核心内容总结

全球各行各业(机器人、脑机接口、互联网巨头等)都在竞逐“世界模型”——这个能让AI真正理解物理世界规律、预测甚至互动改变现实的技术。海外玩家路线分化明显,中国公司更贴近产业落地;脑机接口企业开辟了从“意念到动作”的独特路径。行业虽对技术架构有分歧,但共识是“不能只停留在生成视频”,资本狂热入场的同时,还面临路线未收敛、落地难、数据壁垒三大挑战,最终谁能胜出,取决于数据质量、产业理解和工程能力的综合比拼。

1. 全球抢的“世界模型”:AI的物理世界说明书

简单说,世界模型就是让AI像人一样“懂”现实世界的规则——比如杯子掉地上会碎、推桌子会移动、球扔出去走抛物线。过去的AI大多只会处理文字图片,现在这些公司想让AI能“看见、理解、预测、甚至动手改变”物理世界。参与玩家背景各异:机器人公司想让机器人更聪明,脑机接口公司想把意念转化为动作,互联网巨头有数据优势,大家从不同方向逼近同一个目标:让AI不再“纸上谈兵”,能在真实世界里干活。

2. 中外路线大不同:海外分化,中国务实

海外玩家各走各的路:

  • 英伟达用大规模视频数据做基础模型(相当于给AI看海量现实视频学规律);
  • DeepMind搞“可交互世界生成”(比如生成一个虚拟世界让AI练习互动);
  • 李飞飞团队从空间智能切入(比如让AI理解房间布局);
  • 特斯拉押注机器人的行动能力(先把机器人身体做灵活,再让它懂世界)。

中国公司更贴近实际落地:

  • 生数科技把视频生成技术迁移到通用世界模型,把“理解、预测、生成、行动”打包进一个系统;
  • 大晓机器人直接针对家庭、零售、酒店等场景,把视觉、语言、触摸、动作轨迹整合到一起,让机器人能直接干活。

3. 吵归吵,但都认一个理:光生成视频不够

行业内有分歧:

  • 生数科技认为视频生成和机器人控制底层规律一样,应该用通用基座;
  • 大晓机器人说物理场景不能出错(比如机器人摔碎杯子会造成损失),必须在技术里内置“物理推演”能力(比如知道怎么拿杯子才不会掉)。

但共识很明确:能生成好看的视频只是“入场券”,真正的门槛是“能预判物理世界下一步”。比如视频生成模型像“画家”,能画出现实场景,但不会知道推桌子会动;而世界模型要像“工程师”,不仅懂规则,还能指导动作。

4. 资本热得发烫,但三大坎拦路

资本已经疯狂:过去两年国内新成立370多家具身智能企业,不少估值超百亿,每周都有新项目递计划书。但现实挑战不小:

  • 路线没定:到底做通用模型还是专用场景模型?是侧重视频还是物理预判?大家还在摸索;
  • 落地难:演示视频很惊艳,但实际用起来可能不实用(比如机器人在实验室能拿杯子,到家里就不行);
  • 数据壁垒:没有独特的真实场景数据(比如机器人在家庭里的互动数据),或者没能力大规模采集数据的公司,容易被边缘化。

5. 终局淘汰赛:比三样东西

谁能笑到最后?关键看三个能力:

  • 数据质量:有没有真实、独特的场景数据(比如脑机接口公司的“意念-动作-反馈”数据);
  • 产业理解:懂不懂实际行业需求(比如家庭机器人需要解决什么具体问题);
  • 工程能力:能不能把技术变成能用的产品(比如把世界模型装进机器人,让它在真实场景里稳定干活)。

另外,当AI能自主决策时,安全和治理也会成为必须考虑的问题——比如机器人会不会误伤人类?这些都得提前规划。

总的来说,世界模型是AI从“虚拟”走向“现实”的关键一步,现在大家都在跑马圈地,但最终胜出的,一定是能解决真实问题、有硬实力的玩家。