虎嗅

世界模型的GPT时刻:距离物理AGI出圈,还有多远?

该文章尚未提供 日本語 解读,以下为中文版内容。

核心内容总结

这篇对话围绕“世界模型”展开,几位专家讨论了它的定义、与视频生成的区别、突然爆火的原因、技术路线、数据瓶颈、评测标准及未来格局。核心观点包括:世界模型不是单纯的视频生成(关键是可交互性和世界状态),2023年因扩散模型突破和LLM资源溢出走红,技术路线分生成式、表征式、混合式,数据上依赖“互联网视频+仿真+真机”金字塔补充,未来会是“少数通用基模+大量垂类精调”的格局,但目前缺乏统一评测标准,自进化和交互性是亟待解决的硬骨头。

详细拆解

1. 世界模型≠视频生成:差的是“能互动的世界状态”

很多人以为Sora这种视频生成模型就是世界模型,但专家们说不是。核心区别在于可交互性和世界状态

  • 视频生成(比如Sora)像拍电影,画面是固定的,你只能看不能改,时间长了还会“穿模”(比如杯子突然消失)、违反物理规律(比如人悬浮)。
  • 世界模型像能互动的游戏世界:它得“记住”每个物体的状态(比如杯子的位置、重量、材质),你推它,它会按照物理规律倒;你让机器人拿东西,它能实时调整动作。这种“状态记忆”和“互动反馈”是视频生成没有的。

朱政把世界模型分成三类:①渲染器(生成视频/3D世界,比如能漫游的虚拟场景);②仿真器(给机器人练手的虚拟环境);③规划器(能生成动作指令,比如机器人怎么拿杯子)。

2. 为什么现在世界模型突然火了?两大推力+需求倒逼

世界模型不是新概念,但2023年突然成风口,原因有三:

  • 技术突破:以DiT为代表的扩散模型能从海量视频里学到物理规律(比如东西掉下来会落地),这是以前做不到的。
  • 资源溢出:LLM(大语言模型)火了之后,带来了大量资金、算力和人才,这些资源自然流到其他AI领域(比如视频/世界模型)。
  • 需求逼的:①自动驾驶需要大量“极端场景”数据(比如雨天路滑),但真实采集成本太高,世界模型能快速生成;②具身智能(机器人)的VLA模型泛化性差(没见过的场景就不会做),世界模型从互联网视频里学了各种场景,能补VLA的短板。

3. 技术路线三选一:哪条能走到“真正理解物理世界”?

目前有三条路线,各有优劣:

  • 生成式路线:直接用视频生成基模(比如Stable Video),优点是能直接生成画面,基建成熟;缺点是算力消耗大,实时推理(比如控制机器人)效率低,容易穿模。
  • 表征式路线:像人脑一样在“隐空间”推理(不渲染画面),优点是效率高,更接近人类认知;缺点是没法输出可视化画面,难用于游戏、内容创作等场景。
  • 混合式路线:折中方案,比如训练时生成视频,推理时只输出动作(节省算力),或者结合3D重建校准物理规律。专家们认为这是目前最实用的路线,未来可能走向“表征+生成+理解”一体化(比如Cosmos 3模型)。

4. 数据是命门:世界模型怎么补“数据金字塔”的缺口?

行业公认具身数据是“金字塔”:底层(互联网视频,量大但质量低)、中层(仿真数据,可控但不真实)、顶层(真机数据,质量高但贵)。世界模型的作用是补充,不是替代

  • 对自动驾驶:生成极端场景数据(比如突发事故),节省真实采集成本。
  • 对零售:快速生成海量SKU(商品)的虚拟数据,不用真机拍。
  • 第一人称(ego)数据更金贵:比如头戴摄像头记录的“意图-动作-结果”(比如伸手拿杯子的全过程),能教模型因果关系,但采集麻烦(要带IMU、SLAM等设备),噪声大。

但跨任务/跨机型泛化还不行:比如训练时用的是机械臂A,换机械臂B就不会动了,因为没学会背后的物理规律。

5. 未来:通用基模+垂类精调,评测和自进化是硬骨头

  • 格局预测:像LLM一样,少数公司做通用世界模型(需要大量资金和人才),多数公司在基模上做垂类精调(比如自动驾驶、机器人、游戏)。物理世界场景太复杂,垂类模型的ROI(投入产出比)更高。
  • 最大挑战:①评测标准缺失:现在只看视频画质,忽略“可交互性”(比如模型能撑多久不崩、动作是否符合物理规律);②自进化能力:模型要能从失败案例里学习(比如机器人拿杯子掉了,下次调整),还要和agent调度系统结合(让机器人24小时持续工作)。
  • 算力影响:就算算力再降一个数量级,通用基模还是少数,因为垂类场景的需求太细分了。

一句话总结

世界模型是能互动、懂物理的“虚拟世界”,现在火是技术和资源到位了,未来会像LLM一样分通用和垂类,但要真正“理解物理世界”,还得解决交互性、自进化和评测这些硬骨头。

(全文没有堆砌术语,用游戏、电影、机器人等例子让普通人能懂~)