第一财经

展台能跳舞,工厂拧不准,具身智能的“大脑”还在补课

核心内容总结

当前人形机器人行业正处于“热潮与现实脱节”的阶段:展会上机器人跳舞、叠衣服的炫酷表现让人期待通用机器人时代到来,但实际落地时,机器人能真正干的活远不如展示的那么多——核心瓶颈在于“大脑”(具身智能)和“身体”(硬件执行)的协同不足:大脑能发出指令,但手抓不住东西、精度不够;技术路线尚未统一,数据短缺;虽有泡沫(估值与实际价值不匹配),但长期看,解决数据和实际价值问题后,行业有望在2-10年内迎来类似ChatGPT的爆发时刻。

一、展台很炫,但机器人“手笨脚拙”干不了活

展会上的机器人能跳舞、叠衣服,看起来很智能,但到了工厂或家庭,就“掉链子”:比如想抓杯子却打滑,捏盒子用力过猛捏扁,开不了带锁的柜门。原因很简单——大脑能想明白,但身体做不到。

机器人的“身体”瓶颈主要在三个地方:

1. 手太笨:灵巧手的力气控制(力控)精度不够,要么抓不牢,要么捏坏东西;

2. 脚不稳:双足走路容易摔跤,平衡能力差;

3. 全身不协调:做动作时流畅度不够,比如从桌子上拿东西再放到柜子里,中间会卡顿。

工业场景要求更高:工厂需要毫米级甚至亚毫米级的精度(比如组装汽车零件),但现在机器人的操作精度还停留在厘米到毫米级,根本达不到工业标准。所以目前机器人主要用在科研、表演或教育,工业应用基本是“噱头大于实际”。

二、落地难的三大“拦路虎”:泛化、精度、效率

就算机器人能勉强干活,要真正走进工厂或家庭,还得跨三个门槛:

1. 泛化能力差:换个场景就不会了。比如在固定实验室里,机器人能完美叠衣服,但换个不同材质的衣服、不同光照的房间,成功率就暴跌;

2. 精度不够:工业上拧螺丝要亚毫米级(比头发丝还细),但机器人现在最多做到毫米级,差了一个量级;

3. 效率太低:机器人做简单装配的速度比人工慢很多,比如汽车工厂里,机器人装一个零件要10秒,人工只要3秒,企业自然不愿用。

还有个更深层的问题:物理世界太复杂,机器人没法用一套规则应对所有情况(比如工厂里突然掉个零件、家庭里孩子把玩具扔到地上),模型和数据也覆盖不了这么多意外。

三、技术路线:从“模仿学习”到“预判未来”

机器人的“大脑”(具身智能)正在经历一次大升级:

  • 过去:VLA模型(模仿学习):就像教机器人“照猫画虎”——给它看大量视频,让它模仿动作。但只能在静态、固定场景下干活,换个环境就懵了;
  • 现在:世界模型(预判未来):机器人能“预测”接下来会发生什么。比如拿杯子时,它能预判杯子会不会滑,提前调整手指力度;走路时,能预判地面有没有坑,主动避开。这解决了VLA的泛化和动态场景问题,但目前还在实验室阶段,没大规模落地;
  • 共同瓶颈:缺数据:现在的具身模型参数只有70亿左右(比早期语言模型的千亿级小很多),训练用的GPU也少(几十张卡就够)。要达到ChatGPT那样的智能,得用千卡、万卡级别的集群训练,还需要更多真实世界的数据。

四、泡沫之下,行业在理性生长

现在行业确实有泡沫:公司估值很高,但实际创造的价值很少。比如宇树科技作为“人形机器人第一股”,上市后股价接近腰斩,就是因为市场发现它的产品还没真正落地。

但泡沫不全是坏事:适度泡沫能吸引资金和人才,加速技术迭代。行业大佬们认为,未来爆发点在于两个关键:

1. 解决数据短缺:积累更多真实场景的数据(比如机器人在工厂、家庭里干活的视频和动作数据);

2. 产生实际价值:机器人能做人类不想干或干不了的活(比如下煤矿、照顾老人)。

什么时候才算真正爆发?王兴兴(宇树科技创始人)说:“如果机器人能带到任意陌生环境(比如家庭),完成80%左右的任务,就到了具身智能的ChatGPT时刻,快则2-3年,慢则5-10年。”

现在展台的灯光很亮,但真正的考验在没有聚光灯的地方——工厂流水线、家庭厨房,那些需要机器人日复一日稳定干活的场景。

总结:人形机器人行业现在是“看起来很美,干起来很难”,但长期潜力巨大。要跨过硬件、数据、技术路线的坎,才能从“表演”走向“实用”。泡沫会慢慢挤掉,留下真正解决问题的公司。