第一财经

机器人为什么还不够聪明?具身智能不缺融资、缺数据

该文章尚未提供 Русский 解读,以下为中文版内容。

核心内容总结

具身智能(能在真实世界动手互动的机器人)是当前科技圈的热门赛道,资本疯狂涌入,但机器人始终不够“通用”(换个任务或场景就失效)。核心瓶颈是物理交互数据稀缺——机器人需要学的是人和物体、环境的真实互动(比如拿杯子、开门),这类数据远不如互联网文本多,缺口达100万到1亿倍。传统用真实机器人采集数据又贵又慢,行业正转向“用算力造数据”(视频+仿真生成),资本虽热情但开始更看重落地效果和客户复购,不再只听故事。

详细拆解

1. 机器人“不通用”的病根:缺“真实互动数据”

机器人要像人一样啥都能干,得学无数真实场景的互动——比如怎么拿不同形状的杯子、怎么在不同地面上走路。但这类“物理交互数据”天生少:互联网有海量文字/图片,可机器人需要的是“动手做”的过程数据。

现在全球头部企业最多只有30万小时的高质量真机数据,而要实现通用,可能需要千万甚至亿万小时。按行业测算,数据缺口是大语言模型(比如ChatGPT)的10⁶到10⁸倍——相当于你想考满分,但只做了1道题,离目标差100万道,所以机器人的“ChatGPT时刻”还远着呢。

2. 传统采集数据的坑:又贵又慢,根本喂不饱模型

过去大家靠真实机器人采集数据,但这招成本高、产能低:

  • 人工采集:一个人一天只能采几百条数据,一个月才万条,远跟不上模型对数据“指数级增长”的需求;
  • 标注成本:让机器人学复杂动作(比如炒菜),得人工标上万条数据,任务越多成本越高,线性累加根本扛不住。

这就像你想种一片森林,却只能每天种1棵树,啥时候才能成林?

3. 新解法:用算力“造”数据,成本降几十倍

行业开始换思路——“用算力换时间”:用互联网视频(比如抖音里的做饭视频)和自研仿真器生成数据,代替真机采集。

比如RoboScience公司把“物体运动轨迹”(比如杯子从桌上到手里的路径)作为数据格式,搭了全自动数据生产线:

  • 成本:一条数据才几分钱,是真机采集的几十分之一;
  • 产能:只要算力够,想生产多少就多少(理论无上限)。

他们今年计划把视频数据搞到千万小时,仿真数据到TB级,快接近ChatGPT数据量的十分之一了——相当于用机器批量造树,森林很快就能起来。

4. 资本态度:热但更挑,不看故事看真本事

虽然赛道火,但资本不再盲目撒钱:

  • 上半年融资数据:国内288起融资,460亿,49家公司半年融了两轮以上,热情还在;
  • 但机构更谨慎:只投能解决核心问题(比如数据缺口)的团队,而且要看“真实落地”(机器人有没有真的在工厂/家庭用起来)和“客户复购率”(客户会不会再买)——这些才是真能力,光讲“通用机器人”的概念没用了。

一句话总结

具身智能是好赛道,但想让机器人像人一样通用,得先填“数据大坑”;现在行业用算力造数据的思路有希望,但离真正爆发还有段距离,资本也开始务实了。普通人看这个领域,别只看估值,得看有没有真解决数据问题、有没有真落地。