虎嗅

世界不再预制,下一代模型往哪走?

一、核心内容总结

这是一场由香港多所高校AI领域一线青年学者参与的行业圆桌讨论,全程没有炒概念吹风口,全是对当下爆火但定义极其模糊的「世界模型」的落地痛点拆解:既纠正了很多人以为「AI能生成视频就是世界模型」的普遍误区,也戳破了「靠扒全网视频就能喂出通用机器人」「很快就会出现机器人版ChatGPT」的流行幻想,甚至提出了行业现在天天挂在嘴边的「百万小时训练量」是无效宣传数字等反常识判断。最终学者们达成的共识是:目前世界模型的技术路线完全没定型,根本不是只有大公司能玩的资本游戏,小团队和创业者从细分场景切入依然有大量突围机会。

---

二、分点通俗解读

1. 现在市面上99%号称的「世界模型」,全是半吊子

很多人以为AI能生成猫踩翻水杯的连贯视频,就算是世界模型了,其实这完全是两码事:现在的视频生成AI只是把像素拼得符合你视觉上的熟悉感,它根本不知道水杯掉地上会碎、水会流出来,甚至水杯被桌角挡住看不见了,它都能直接把水杯变没。

学者们眼里真正合格的世界模型,核心能力根本不是「预测下一帧画面」,而是要像人一样懂真实世界的运行规则:你让它伸手推杯子,它能提前预判杯子会滑多远、水洒多大,哪怕杯子被挡住看不见,它也知道杯子还在原地,不会凭空消失。现在做视频生成的团队、做无人驾驶的团队、做机器人的团队,嘴里说的都是「世界模型」,但走的完全是不同的路线,还远没到会师的那天。

2. 想靠刷全网视频喂出通用机器人?根本没那么美

之前很多人有个幻想:ChatGPT靠扒完互联网所有文字就成了通用大模型,那我把抖音、B站所有人类拍的视频全喂给机器人,不就能直接训出啥都会干的通用机器人了?学者们直接给这个想法泼了冷水:完全行不通。

首先互联网上的视频全是「光鲜的成功记录」:你刷到的全是人类稳稳拿住杯子、顺利切菜的画面,几乎没人会拍自己手滑摔碎杯子、切菜切到手指的10秒废片,但机器人最需要学的恰恰是「什么情况下我会出错」,这些边界条件的失败数据互联网上根本找不到。其次就算是人类戴GoPro拍的第一视角做家务视频,人的手的灵活度、动作幅度和机械臂、人形机器人完全不一样,你看100个奥运冠军跳水的视频,自己跳还是会结结实实拍在水面上——你没长人家的身体,光看动作演示根本没用。互联网视频只能当机器人的「启蒙课外书」,绝对替代不了它自己在现实里摸爬滚打攒出来的真机交互数据。

3. 别吹什么「具身智能ChatGPT时刻」,现在连及格线都没摸到

最近很多机器人公司发个demo,演示一下听指令开门、倒水,就喊「具身智能的ChatGPT时刻来了」,学者们直接拆穿了这个营销噱头:这根本不算数。

ChatGPT的核心能力是「遇到从来没见过的陌生问题,也能给出靠谱答案」,但现在的机器人所谓的「听指令干活」,本质上是你告诉它「调用你之前练过100次的开门技能」而已:它之前练的是把手是圆的、门特别轻的办公室门,你换个把手是方的、锁有点卡的老房子门,它大概率直接傻住。而且机器人的通用能力绝对不会像ChatGPT那样突然炸出来:它肯定先在工厂场景里跑稳,比如固定给工业机械臂拧螺丝、搬零件,先把B端的价值做出来,才敢慢慢进普通人的家里——不然机器人在你家摔一跤砸了你的电视,谁都担不起这个责任。

4. 行业吹的「百万小时训练量」,基本都是无效数字

现在很多具身智能公司宣传自己的技术实力,总爱说「我们的机器人已经跑了10万小时、百万小时数据」,但学者们直接说:这个小时数就是个方便宣传的数字,根本不能代表机器人学到了多少东西。

举个最直白的例子:你家的扫地机器人天天在你家客厅转,转100小时都是重复走同样的路线,连个新东西都没碰到,这100小时的信息量,还不如它1分钟里碰倒了你的水杯、然后试着把杯子扶起来学到的东西多。之前语言模型用「token(字)」算数据量,是因为每个字都是新信息,但机器人的时间是可以光明正大划水摸鱼的:重复1万遍一模一样的动作,跑1000小时也白搭。未来机器人的有效数据单位根本不该是小时,而是「关键动作变化次数」:它有没有碰到新物体、有没有动作失败、有没有把东西碰移位,这些才是真正能让它变聪明的有效信息。

5. 未来的机器人大脑,根本不用给每个身体单独定制

现在的机器人有个特别傻的毛病:如果我把机械臂从30厘米换成1米长,之前写好的所有控制程序全废了,得重新从零开始训练,成本高得离谱。但人完全没有这个问题:你戴个厚手套、换个加长的钳子,试两下就知道怎么用,根本不用重新学怎么拿东西。

未来合格的世界模型,就要练出这种「一脑适配百种身体」的通用能力:不管我装的是2根手指的手还是4根手指的手,不管我手臂力气是1公斤还是10公斤,它都能先快速搞清楚自己的身体能伸到哪、力气有多大,然后自动调整动作,不用每个新机器人都从零开始训。等这个能力跑通了,机器人的落地成本才能真正打下来。