第一财经

直击亚布力论坛|具身智能何时迎来“GPT时刻”?

该文章尚未提供 Русский 解读,以下为中文版内容。

核心内容总结

这篇新闻聚焦亚布力创新年会上机器人与具身智能的行业动态:目前具身智能大模型(机器人的“聪明大脑”)还处于早期阶段(类似ChatGPT发布前1-3年),技术路线正从“看像素”转向“懂因果”的隐空间世界模型;落地节奏上工业场景先突破,C端(家庭等)还需时间,2026年是量产元年,明年有望出现能稳定干活的机器人;同时行业还面临硬件成本、算力、泛化能力等挑战,企业们正积极布局研发和融资。

1. 具身智能大模型:还在“学走路”阶段,离“ChatGPT时刻”差几步?

你可以把具身智能大模型理解为机器人的“大脑”——它得能听懂指令、看懂环境、自己做决策完成任务。现在这个大脑还不够聪明:宇树科技的陈立说,它相当于ChatGPT发布前1-3年的水平,还没法应对大多数陌生场景。

什么时候才算“成熟”?陈立给了个明确标志:机器人在80%没见过的场景里,能靠语音/文字指令完成80%的任务。比如你让它去陌生办公室拿文件,它得自己找门、避障碍、识别文件,现在还做不到。所以机器人还没大面积应用,核心就是这个“大脑”没练熟。

2. 技术路线换道:从“像素级复刻”到“懂世界规律”

以前的具身智能技术(比如VLA架构)更像“照猫画虎”——机器人靠视觉看像素、靠语言理解指令,但遇到没见过的情况就懵。现在行业转向“隐空间世界模型”,简单说就是让机器人学“常识和因果”:

比如无界动力的张玉峰解释,这个模型不是把世界的每个细节(比如桌子上的灰尘)都复制下来,而是抓核心规律——比如推杯子会倒、开门需要转把手。这样机器人不用记住所有场景,而是像人一样“懂道理”,能应对更多新情况。虽然这个技术更难,但大家觉得这是通向通用机器人的正确路。

3. 落地节奏:工业场景先“上岗”,C端还要等几年

行业人士普遍认为,机器人不会先走进你家,而是先去工厂。为啥?工业场景相对固定:比如流水线搬零件、仓库理货,任务重复且环境可控,机器人容易训练。而C端(比如家庭机器人)场景太乱:你家的沙发位置、杯子摆放都不一样,机器人很难适应。

张玉峰说,2025年全球人形机器人产量有2万台,但基本“不会干活”;2026年是量产元年,能完成从0到1的突破(比如能稳定做一两个工业任务);明年可能会出现“认真干活”的机器人——比如能在工厂里持续搬东西不犯错,这会让量产速度加快。

4. 普及机器人的“拦路虎”:硬件、算力、成本

就算“大脑”练好了,机器人要普及还得解决几个硬问题:

  • 硬件:得更便宜、更耐用。比如现在机器人的关节、传感器成本高,寿命短,普通人用不起。
  • 算力:机器人的“大脑”需要计算,但端侧(机器人本身)算力不够(续航、散热、成本都是问题),云端(远程服务器)又有延迟(比如机器人反应慢)。
  • 大规模制造:得能像造手机一样批量生产机器人,不然成本降不下来。

这些问题不解决,机器人还是“小众玩具”,没法走进普通人的生活。

5. 企业们在忙啥?抢研发、补资金、抓场景

行业里的公司都在紧锣密鼓布局:

  • 宇树科技:在搞具身智能“大脑”,还采集真实场景数据(比如工厂、办公室),让机器人学干活,不用人天天盯着。
  • 无界动力:主攻隐空间世界模型,还在融资——张玉峰说要抓住现在的融资窗口,补“弹药”搞研发。
  • 其他企业:比如眸深智能,也在探索世界模型技术。

大家都想在这个赛道里抢先机,毕竟谁先把“聪明大脑”搞出来,谁就能领跑机器人时代。

总的来说,具身智能机器人现在处于“黎明前的准备期”——技术在突破,量产在起步,但离真正普及还有段路要走。不过行业的信心很足,明年可能就能看到能“稳定干活”的机器人,让我们拭目以待。