核心内容总结
这篇文章围绕AI领域的“世界模型”展开,指出当前大语言模型(如ChatGPT)因缺乏真实世界体验,在物理推理、空间规划等任务中存在致命短板;而“世界模型”作为能模拟现实后果的系统,被视为通向通用人工智能(AGI)的关键路径。文章还介绍了世界模型的认知科学渊源、商业落地进展(资本涌入、头部企业布局)、技术路线分歧(像素级重构vs抽象表征),以及它离AGI仍存在的诸多差距(时间抽象、元认知等)。
详细解读
1. 大语言模型的“致命短板:不懂真实世界的‘常识’
用一个简单例子就能看出来:问AI“杯子掉地上会怎样”,它会说一堆“重力势能”“应力波”的专业词,但五六岁小孩只会说“杯子碎了”。为啥?因为LLM(大语言模型)的核心是“预测下一个词”,靠海量文本训练,但它从来没亲眼见过杯子掉地上——没有真实世界的体验,就无法真正理解物理规律。
比如导航时,LLM能背出路线,但让它绕路就懵了(因为它只有文字描述,没有人类那种“心智地图”);叠衣服这种日常任务,LLM更是完全不会——它只懂“描述”,不懂“现实”。这就是LLM的本质缺陷:它是“文字专家”,不是“现实专家”。
2. 世界模型:让AI像人一样“脑补”后果的系统
世界模型的 idea 来自1943年心理学家克雷克:人类大脑里有个“小模型”,能模拟不同行动的后果(比如想“杯子掉地上会碎”,就不会故意碰它)。后来的“预测加工理论”进一步说:人的感知就是不断预测世界,再用眼睛、耳朵的信息修正。
AI研究者想让AI也有这个能力:在行动前,先在内部模拟后果,避免现实中犯错。比如杨立昆(图灵奖得主)说:“没有预判能力的AI不算真智能——智能就是用想法替我们试错。”
3. 资本扎堆押注:世界模型成AI新赛道
最近两年,世界模型成了资本和巨头抢的香饽饽:
- 李飞飞(AI大牛)创办的World Labs融了2.3亿美元,做“空间智能”;
- 杨立昆离开Meta,创立AMI实验室融了10亿美元,专门搞世界模型;
- 谷歌DeepMind的Dreamer4系统,看了很多《我的世界》录像,能自己摸索采钻石(要几千步操作,比如收集资源、造工具)。
不过这些还都是原型:比如World Labs的Marble只是3D场景生成器,Genie3像游戏模拟器——离真正能做家务的机器人还差得远。
4. 技术路线打架:像素级还原vs抽象抓重点
现在有两条主要路线,吵得厉害:
- 像素级重构:比如Dreamer4,学的时候要还原每一个像素,力求精准模拟行动后的世界。好处是细节全,但数据需求大;
- 抽象表征:杨立昆的JEPA路线,不还原细节,只抓对推理有用的关键信息(比如杯子掉地上会碎,不用管每块碎片的位置)。好处是数据少,但问题是:抽象的信息够不够支撑复杂推理?比如V-JEPA2能学物体运动规律,但还没证明能支持开放环境的智能体。
两边各有道理:哈夫纳(Dreamer4负责人)觉得像素级也能学到抽象,杨立昆觉得抽象更高效。
5. 离AGI还差得远:缺的不只是世界模型
就算世界模型做得再好,离AGI(像人一样啥都能干的智能)还有很多坎:
- 时间抽象:AI现在只能预判下一秒,不能想“长期后果”(比如人类想“现在努力学习,以后找好工作”);
- 元认知:AI不知道自己懂啥不懂啥——它乱回答也不知道自己错了;
- 多层因果和他人思维:人类能理解复杂因果(比如“因为下雨,所以路滑”),还能猜别人想啥(比如“他皱眉是因为生气”),但AI做不到。
专家说:世界模型是必要条件,但不是充分条件——AGI需要更多能力的组合。
最后一句话总结
世界模型是AI向AGI迈进的重要一步,但它不是“万能药”——要让AI真正像人一样思考,还有很长的路要走。