虎嗅

外滩大会上的具身智能讨论:大规模数据采集还有必要吗?

一、核心内容大白话总结

最近能在现实世界里自主摸东西、干活、到处走的「具身智能机器人」赛道火得发烫,融资热度、媒体声量都居高不下,但之前全行业都在摸着ChatGPT的路子走,以为堆数据、堆参数就能快速出结果,走了不少弯路。这次外滩大会上几个业内顶尖的创业者、科学家聊透了行业的最新共识:具身智能根本没法复制大语言模型的发展路径,之前大家吵的“堆多少真实数据、通用大模型会不会抢饭碗、机器人什么时候能落地赚钱”这些问题,现在都有了明确的新答案——接下来的行业竞争,早就不是单比谁的模型厉害,而是要拼数据、硬件、系统、场景全链条的综合能力,整个行业正在从“炒概念秀Demo”往“真落地赚真钱”的拐点走。

---

二、详细拆解解读

1. 行业刚踩完第一个大坑:以为抄ChatGPT“堆数据量”的作业就行,现在发现完全走不通

之前大语言模型靠喂进去几万亿字的互联网文本,能力直接跳级,所以很多人想当然觉得:具身智能机器人也一样,我攒个几百万小时机器人搬东西、走路的视频数据,堆进去模型自然就变强了。

结果现在业内集体反应过来:这思路错得离谱。首先你攒的大部分数据都是没用的“脏数据”,比如让机器人天天重复“拿矿泉水抬上抬下”,录几百万小时也练不出它拿保温杯、拿装了热水的暖壶的能力,就像你背100万遍1+1=2,也不会做新的应用题。

现在大家达成的共识是:数据的“质”远重于“量”,那些包含真实物理世界规律的经验才值钱——比如东西滑了怎么抓、地上有水怎么走不摔、软的东西怎么拿不会变形,这种复杂长程任务里攒出来的数据,比100万小时重复无效采集的数据有用100倍。之前很多公司砸钱建的“数据工厂”瞎采的无效数据,本质就是行业发展初期交的学费,属于摸着石头过河的必然代价。

2. 数据路线彻底变天:不卷“谁存的数据多”,改卷“把真实世界搬进电脑”的虚实能力

之前行业吵了很久:训练机器人到底是用真实场景里采的数据好,还是在电脑仿真虚拟世界里生成的数据好?之前大家觉得这俩是二选一的路线,现在大佬们直接给出了新方向:这俩根本不用选,反而要搞「把真实世界的物理特征1:1搬进仿真器」。

举个例子:现实里一杯水泼在瓷砖上,水渍的形状、地面滑度变化、不同重量的东西压上去水渍怎么变形,这些细碎的真实物理特征,你全部精准输进电脑的仿真系统里,机器人在虚拟世界里可以一天练10万次踩水不滑倒、抓不同重量的水杯不洒,效率是在真实世界里训练的几百倍,还不会把机器人摔烂、不用浪费真实的耗材。

以后数据竞争根本不是比谁手里存了多少小时的视频,而是比谁能把真实物理世界的规则更完整、更精准地搬进电脑,谁就掌握了训练机器人的最高效武器。

3. 之前大家怕的“GPT降维打击机器人行业”,现在看完全是杞人忧天

前阵子OpenAI出了能直接控制机器人的GPT-6 Astra,好多人喊“通用大模型公司进场,所有具身智能创业公司都要被干死”,结果业内人直接给这个结论泼了冷水:根本不可能。

道理很简单:AI的能力全是从对应领域的数据里炼出来的,大模型之前攒的全是互联网文字、代码、图片的数据,这些数据半毛钱都帮不上你控制机器人走路、抓东西。通用大模型要做机器人,得从头开始攒机器人传感器的物理数据、适配各种电机硬件、搭整套仿真训练系统,这些活一个都少不了,难度一点都不比创业公司从零做低,说白了它过来干这些事,本质就是个新的具身智能创业公司,之前攒的文字能力反而很多是冗余的。

反而现在的具身智能创业公司,已经踩过无数硬件适配、场景落地的坑,手里攒的专用数据是大模型没有的,最后面向机器人场景做出来的专用小模型,反而比大模型改出来的通用版更好用——毕竟机器人要反应快、成本低,没必要装一堆写文案、编段子的没用功能。

4. 机器人商业化的判断标准特别直白:别秀Demo,看客户愿不愿意持续掏钱

之前大家看机器人展会,全是秀Demo:端茶倒水、叠衣服、拧螺丝,看着特别厉害,结果买回去一用,换个场景就傻了,根本没法干活。现在业内直接把虚的标准全扔了,判断商业化成不成功就一个硬指标:客户能不能持续给你付钱,而且付的钱越来越多。

说白了就是你这个机器人干的活,比雇人干划算,比之前传统的自动化机器干出来的效果好,投入产出比是正的,客户才会一直买单。之前大家到处找什么“杀手级应用”,现在发现根本不用找:只要机器人能做到进个新场景不用花几十万调试、干活成功率够高、成本打下来,不管是餐厅传菜、仓库理货、养老院陪护,随便哪个场景都能落地赚钱。

现在业内甚至预判,根本不用等大家说的十年八年,3年内就能在很多线下场景看到真正商用、能稳定干活的具身智能机器人,AI改造物理世界的大幕才刚刚拉开。