第一财经

跑步只是入场券,机器人下一步拼什么?

该文章尚未提供 Français 解读,以下为中文版内容。

核心内容总结

这篇新闻围绕人形机器人与具身智能的发展现状展开:当前机器人制造速度(15分钟一台)和动作学习速度(12小时学会跑步)已大幅提升,但智能水平仍不足;具身智能离“GPT时刻”(像ChatGPT那样的能力爆发)还有差距,主要瓶颈是数据、模型、算力不足,且行业存在技术路线分散、标准不统一的问题;目前有两种发展思路——“堆数据算力”和“理解动作目标”;规模化部署需解决开源、标准、商业化难题,不同场景落地时间预计3-8年。

一、造得快学动作快,但智能还差得远

现在的人形机器人“硬件速度”已经很惊人:20多年前造一台要5年,现在展馆附近的工厂15分钟就能下线一台;学跑步也只要12小时。但这些都是“表面功夫”——机器人只是模仿人类动作,不懂为啥要做这个动作。比如切面包,不同人用不同手法,但机器人只会复制动作,不知道最终是为了做三明治。这种“模仿式学习”虽然让行业发展快,但没法大规模扩展(比如换个任务就得重新学),所以智能水平还停留在“会做动作”,没到“会思考目的”的阶段。

二、具身智能为啥没迎来GPT时刻?三大瓶颈+数据难题

大家都在问:具身智能啥时候能像ChatGPT一样突然爆发?答案是还早,主要差在三个地方:

1. 模型太小:现在具身智能模型的“知识量”(参数规模)才70亿左右,而早期GPT都有千亿级,差了十多倍;

2. 算力不够:训练具身模型用几十张甚至几张GPU就行,而GPT需要上万张;

3. 数据太少:语言模型能直接用互联网的文字数据,但机器人需要的是物理世界的数据(比如机械臂抓软东西、适应不同光线),这些数据没法随便从网上拿,采集成本高还覆盖不全(比如极端天气场景)。

专家说,具身智能至少比语言模型落后5年,没有足够的数据、大模型和算力,就不会有GPT时刻。

三、两条路线之争:堆数据算力vs理解目标

面对瓶颈,行业分成两派:

一派是“堆规模”:继续加大数据、模型和算力。比如用“合成数据”(用GPU模拟极端场景,像隧道里突然变光)来补真实数据的不足,再把模型参数做大,期待像GPT那样“能力涌现”。

另一派是“懂目的”:不盲目堆数据,而是让机器人理解动作背后的目标。比如Gordon Cheng团队的机器人,观察人类切面包后,不是学具体动作,而是知道“切面包是为了做三明治”,这样换个面包或者刀,也能完成任务。这种思路不用学太多动作,还能把能力做成“压缩包”发给其他机器人,节省数据和时间。

四、规模化部署卡在哪?标准不统一+重复研发

就算技术突破了,机器人要走进工厂、家庭,还得解决“各自为战”的问题:

  • 技术路线乱:不同企业的硬件、软件都不一样,比如这个机器人的传感器和那个不兼容,导致重复造轮子(同一个问题反复解决);
  • 数据孤岛:每个企业的数据格式不同,没法共享,浪费资源;
  • 商业化难:很多机器人还停留在“样机展示”阶段,长期运行容易坏、成本高,而且定制化太强,没法批量生产。

所以现在行业开始搞“开源和标准”:比如成立人形机器人开源社区,开放操作系统、算法等技术底座,让大家共用一套标准,减少重复研发。

五、规模化落地还要多久?不同场景时间不一样

专家们对落地时间的判断有差异,但分场景来看:

  • 半结构化工厂(比如有固定流程但偶尔变化的车间):3-5年就能大规模部署,因为场景相对可控,机器人能先把任务做到“8分好”,再慢慢优化;
  • 工业和家庭:工业要5-8年,家庭更久(5-8年),因为家庭场景复杂(伦理、安全、长尾问题多);
  • 芯片vs软件:芯片3-5年能达到合适的性能和成本,但软件生态成熟需要更长时间。

总的来说,机器人从实验室到真实世界,还得解决系统协同、标准统一这些“看不见的问题”,而不是只看跑步速度、跳跃高度这些表面指标。

这篇新闻告诉我们:人形机器人的“硬件速度”已经很快,但“智能深度”和“产业协同”才是未来突破的关键。你觉得家里什么时候能有一台会做饭、打扫的机器人呢?可能还要等几年,但方向已经越来越清晰了。