虎嗅

六位具身智能大佬同台:机器人的ChatGPT时刻,还有几年?

该文章尚未提供 Español 解读,以下为中文版内容。

核心内容总结

上海WAIC的“智启具身论坛”上,机器人行业大佬们对“机器人ChatGPT时刻”给出了2-5年的一致预测,但对“这个时刻的具体标准”尚未达成共识;同时围绕三个关键问题展开深度讨论:机器人的数据飞轮如何形成(需真实场景干活积累)、VLA(视觉语言动作模型)是否已死(融合路线才是未来)、全栈能力是否必要(能力要全栈,生意可多样),反映出行业虽未完全收敛,但已明确探索方向。

一、机器人“ChatGPT时刻”:2-5年的数字背后,标准还没对齐

论坛上嘉宾们给出的时间预测集中在2-5年,但对“什么才算机器人的ChatGPT时刻”说法不一。智元的姚卯青给出了明确标准:机器人能开箱即用,听懂普通人随便说的自然语言指令,常见任务(比如拿东西、整理)成功率达到70%-80%;而其他嘉宾(如腾讯张正友、Dyna马也骋等)没定义具体标准。这意味着,看似大家对时间达成共识,实则对“达标线”的理解还存在差异——有人可能指“能完成简单任务”,有人可能指“能应对复杂场景”。

二、数据飞轮:不是“采”来的,是机器人“干”出来的

机器人需要的是物理经验数据(比如拿杯子用多大劲、走路遇到台阶怎么调整),这和大语言模型靠互联网现成文字数据不一样。嘉宾们讨论了几种数据来源:

  • UMI:低成本采集人类操作数据(人拿着设备做任务,系统记录动作和视觉信息,转成机器人能学的经验),短期能快速积累数据;
  • 部署数据:机器人在真实场景(比如酒店折毛巾)中犯错、停顿、恢复的过程数据(教机器人应对意外),是最值钱的“塔尖数据”;
  • 数据金字塔:底层是免费的互联网视频/第一视角数据,中层是真机多任务数据,塔尖是部署数据。

关键问题是“鸡生蛋”:没有足够好的模型,客户不敢让机器人上岗;不上岗,就拿不到最有价值的部署数据。所以,机器人的数据飞轮不是靠“采集”,而是靠“在真实场景里干活”积累出来的。

三、“VLA已死”是伪命题,融合才是未来

VLA(视觉语言动作模型)是“看眼前场景+听指令,直接生成动作”;WAM(世界动作模型)是“先预测动作会带来什么结果,再做决策”。最近行业流行“VLA已死”,但论坛上的讨论推翻了这个说法:

  • PI的任至意说,他们的VLA模型π0.7效果仍领先,且VLA可以融合世界建模能力;
  • Dyna转向WAM是因为某些任务(比如鲁棒性要求高的场景)更高效,但没否定VLA;
  • 腾讯张正友指出,机器人需要分层系统:上层负责推理(比如“今天要打扫房间”),中层负责感知动作(比如“拿起扫帚”),底层负责控制电机(比如“调整扫帚力度”),不可能靠一个模型解决所有问题。

结论:VLA没死,死的是“一个模型包打天下”的幻想,未来主流是融合VLA和WAM的系统。

四、全栈能力要具备,但全栈生意不一定做

机器人公司分两种路线:

  • “大脑路线”:只做模型(比如PI、腾讯),但研发时必须懂硬件(腾讯说“不卖本体,但要做硬件研发,否则不知道模型在实际机器上的限制”);
  • 全栈路线:既做模型又做本体(比如智元、Sunday),因为真实场景里,机器人的可靠性、成本、续航等问题,光靠模型解决不了(比如关节控制、电池续航会限制智能上限)。

未来趋势:全栈能力(懂软硬件)是必须的,但商业模式可以多样——可能出现像苹果一样的全栈公司,也可能出现像安卓一样的模型平台。但现在硬件还没标准化,即使只做模型,也绕不开硬件的限制。

最后:时间不重要,自我加速才是关键

论坛上的时间预测(2-5年)只是参考,机器人的“ChatGPT时刻”真正到来的标志,是数据、模型、本体、真实部署形成自我加速循环:机器人部署越多→积累数据越多→能力提升越快→进入新场景成本越低。在此之前,所有时间表都是预测,所有路线都在验证。但可以确定的是,行业正在快速向“实用化”靠近。