第一财经

怎么让AI真正“下地干活”?中国厂商加速探索世界模型

该文章尚未提供 Deutsch 解读,以下为中文版内容。

核心内容总结

2026年世界人工智能大会(WAIC)上,“世界模型”成为焦点,被行业视为AI理解物理世界规律、实现具身智能(如机器人自主行动)的关键技术底座。多家企业发布相关产品,技术路线多元,但共识是数据规模是突破关键——需积累千万小时级多模态“干活数据”才可能迎来质变。应用上,游戏行业将率先受益,长期看具身智能是核心方向,物理AI的“ChatGPT时刻”预计还需2-5年。

一、世界模型:AI理解物理世界的“大脑模拟器”

简单说,世界模型就是给AI装一个“脑子里的物理世界沙盘”。以前的AI(比如ChatGPT)擅长处理文字,但不懂真实世界的运行逻辑——比如杯子掉地上会碎、推桌子需要用力。世界模型让AI能“模拟”物理规律,像人一样预判行动后果,比如机器人拿杯子时知道怎么用力才不会摔碎,这是它能在真实世界自主行动的基础。

为啥现在火?因为具身智能(机器人、自动驾驶等)要落地,必须先“懂世界”。以前的AI是“纸上谈兵”,现在要“动手干活”,世界模型就是连接数字AI和物理世界的桥梁。

二、企业抢跑:各家技术路线差异大,都在押注未来

WAIC上多家企业亮出了自己的世界模型方案,路线各有侧重:

  • 昆仑万维Matrix-Game3.5:用游戏场景练AI。把游戏里的1200多个场景当训练场,还创新“小方块记忆”(Patch级记忆注入)——把图像切成带坐标的小方块,让AI记住空间位置,保持长期一致。核心架构还开源,想拉更多人一起玩。
  • 蚂蚁灵波LingBot-VA2.0:“原生设计”不嫁接。以前机器人“大脑”是数字模型和物理模型拼起来的,现在直接从“和环境互动”的需求出发设计,比如动态建模、实时执行,更贴合真实场景。
  • 3D生成企业(如影眸科技):做“场景级3D”。以前3D生成是单个物体(比如一个杯子),现在能生成整个房间场景,给AI提供更真实的仿真训练环境,从“看图片”到“进虚拟房间练手”。

各家路线不同,但都把世界模型当成下一个AI竞争的核心。

三、最大瓶颈:数据!要千万小时“干活数据”才质变

行业大佬们一致认为,世界模型的突破关键是数据量和质量

  • 当前水平:多数企业训练数据只有10万小时左右,昆仑这次发布用了20多万小时,离质变还差得远。
  • 需要多少:方汉(昆仑万维CEO)说,至少1000万小时数据才可能出现拐点,多的话要1亿小时。
  • 什么数据才有用:不是随便的视频或图片,而是“干活的数据”——比如机器人拿杯子时,同时记录它的动作、杯子的状态、触觉/力觉反馈(比如握力多大)。它石智航的陈亦伦说,光看视频学不会物理规律,必须要多模态数据(视觉+触觉+力觉等)。
  • 中国优势:方汉认为中国是数据采集硬件的产地(比如传感器、机器人),家政等服务场景也多,能更快积累数据。他预测今年底有厂商能到100万小时,明年底到千万小时,亿小时要3-5年。

四、应用前景:游戏先“吃螃蟹”,长期看机器人“干活”

  • 游戏行业率先受益:开放世界游戏(比如《原神》这类)以前要几百人团队搭几年,现在用世界模型,虚拟世界能随玩家行动实时生长——比如你砍了一棵树,旁边的草会因为阳光变化长高,不用人工设计。未来3-5年,世界模型会成游戏行业的基础设施。
  • 具身智能是长期方向:机器人要进家庭、工厂干活,必须靠世界模型理解环境。但现在还在早期,比如机器人拿东西还容易摔,需要更多数据和技术迭代。

五、物理AI的“ChatGPT时刻”:还要2-5年,需多因素共同进化

行业人士预判,物理AI(能在真实世界干活的AI)的爆发时刻还需2-5年。但共识是:不会靠单一模型或数据,而是需要“数据规模+模型架构+仿真训练+真机反馈+硬件”形成一个循环——比如用仿真场景练AI,再放到真机上测试,反馈数据再优化模型,不断迭代。

就像ChatGPT不是突然火的,是多年数据和模型积累的结果,物理AI的爆发也需要这个“进化飞轮”转起来。

总结

世界模型是AI从“数字世界”走向“物理世界”的关键一步,现在行业处于“抢跑布局”阶段,数据是最大拦路虎,但中国在数据采集上有优势。游戏先受益,机器人是长期目标,物理AI的ChatGPT时刻还需几年,但方向已经明确——让AI真正“懂世界、会干活”。