核心内容总结
2026年具身智能行业(简单说就是能像人一样感知环境、动手动脚的智能机器人领域)火到“发烫”:前7个月融资超750亿(是2025年全年4倍、2024年22倍),行业展会扎堆(世界机器人大会将有300家企业、2000件展品),连给行业提供数据的“卖铲子”公司都比“淘金者”更快拿钱(25家数据公司半年融资170亿)。但行业最关键的缺口不是数据数量,而是“有效关键数据”——大家没统一标准判断哪些数据能真正提升机器人能力、跨场景复用。为此,主办方邀请了四位覆盖数据全链条的专家,围绕“什么数据才是具身智能的高价值资产”展开讨论,并举办闭门直播让相关人士参与。
详细拆解
1. 《具身智能现在有多火?钱和热度都快溢出来了》
- 钱袋子鼓得离谱:2026年前7个月,具身智能领域融资突破750亿,相当于2025年全年的4倍、2024年全年的22倍——两年前全年的钱,现在7个月就赚回来了,资本疯狂涌入。
- 行业热度拉满:刚结束的世界人工智能大会(WAIC)还没降温,世界机器人大会又要开幕,300家企业带着2000件机器人展品参展,热闹得像“机器人庙会”。
- 卖铲子的先赚钱:给行业提供数据的公司(比如采集、处理数据的)比直接做机器人的更先拿到钱——25家数据公司半年融资170亿,说明“数据”已经成了行业的刚需。
2. 《为啥“有效数据”成了卡脖子的大问题?》
现在行业里流行说“100万小时”是具身智能的新指标,但这里有个大误区:采集时长≠有效训练数据。比如采集了100万小时的机器人动作视频,可能只有10万小时能真正用来训练(剩下的要么重复、要么没用)。
行业缺的不是“更多数据”,而是一套统一的“有效数据标准”:
- 这个数据能不能让机器人能力提升?(比如让自动驾驶更稳)
- 能不能跨场景/机器人复用?(比如扫地机器人的避障数据,能不能用到工业机器人上)
- 值得长期花钱存着吗?(不会用一次就过时)
没有这个标准,数据再多也是“垃圾”,所以“有效数据”成了行业最头疼的缺口。
3. 《四位专家从四个角度,帮你搞懂数据价值》
这次请来的四位专家,覆盖了具身智能数据的全链条,各自解答不同痛点:
- 彭湃(酷哇科技):失败数据更值钱
他做自动驾驶机器人,天天面对“翻车”场景(比如突然需要人类接管)。他会讲:一条标注清楚“为啥翻车”的轨迹数据,比100条顺畅的动作数据更有用——因为失败经验能让机器人下次避免犯错。
- 郭俊良(千寻智能):数据配方决定模型上限
他负责模型预训练,研究不同数据源(人类视频、真机示范、仿真生成、失败回流数据)的作用。比如:人类视频能教机器人“语义”(比如知道“开门”是啥意思),真机示范能教“动作细节”(比如怎么握杯子)。他会说:预算有限时,是先搞数据规模还是先抓质量?
- 廉和(光轮智能):数据要闭环才有用
他管数据、仿真和评测。比如:人类数据(比如人怎么炒菜)+仿真数据(在电脑里模拟炒菜)+真实部署数据(机器人实际炒菜),三者闭环才能让模型越来越准。他还会讲:怎么评测数据是否真的提升了机器人能力?
- 郑宇靖(刻行时空):数据要过三道关才能用
他做真实数据生产,知道数据不是采回来就完事——要过工程关(格式统一)、质量关(标注准确)、合规关(不侵权),才能稳定进入训练流程。他会说:不同机器人的数据(比如扫地机器人和工业机器人)怎么统一管理,让模型公司敢用?
4. 《行业最关心的三个“真问题”,全是痛点》
这次讨论不绕弯,直接问三个核心问题:
- 数据从哪来?预算怎么分?
四种数据源(人类第一视角视频、真机远程操作、仿真生成、失败回流)各解决啥问题?比如只有1亿预算,该给仿真生成多一点,还是给失败回流多一点?
- 100万小时里,有用的有多少?
采集1小时数据,能真正进训练集的有几分钟?被丢的为啥丢?成本该按“采集时长”算,还是按“有效数据量”“难例密度”(比如翻车数据的比例)算?
- 数据是壁垒还是公共设施?
换个机器人(比如从扫地机器人到送餐机器人),之前的数据还有用吗?数据归谁(甲方、机器人公司、模型公司还是数据服务商)?能卖的话,还能成为公司的护城河吗?
5. 《这场直播适合谁?能得到啥好处?》
- 适合人群:
做具身智能模型、机器人本体、数据采集/仿真的创业者和技术人;机器人、AI硬件、智能制造上下游从业者;科技投资人、研究者、媒体。
- 能得到的好处:
① 一线专家的共识:啥数据真能提升机器人能力;② 算清成本账:采集多少小时才能得到有用数据;③ 搞懂数据边界:数据归谁、能不能复用/交易;④ 链接资源:对接模型公司、机器人企业、投资人。
直播时间是8月17日19:00-21:00,形式是腾讯会议闭门直播,感兴趣的可以扫码报名~