虎嗅

那家孵化出千亿市值公司的研究院,选择押注世界模型

该文章尚未提供 العربية 解读,以下为中文版内容。

核心内容总结

这篇新闻围绕中国AI研究机构“智源研究院”展开,讲了两件关键事:一是智源是中国大模型创业的“人才摇篮”(很多知名大模型公司创始人都从这里出来);二是在当前具身智能(能和物理世界互动的AI,比如机器人)火起来的背景下,智源又提前布局了“世界模型”——这是让AI真正理解物理世界规律的底层技术,目前还处于早期探索阶段,但被视为AI下一阶段的核心方向。

详细拆解

1. 智源:中国大模型的“黄埔军校”

智源研究院在大模型领域的地位,就像培养人才的“军校”。过去几年,从这里走出了一批明星创业者:比如智谱AI的唐杰、月之暗面的杨植麟、面壁智能的刘知远等,他们创办的公司都是中国大模型赛道的代表。同时,智源自己也搞出了“悟道”大模型,见证了中国大模型从无到有的全过程。简单说,智源既是技术发源地,也是人才输出站。

2. 具身智能火了,世界模型成资本新宠

最近一年,“具身智能”接过了AI的接力棒——就是能像人一样和物理世界互动的AI(比如机器人)。数据显示,2026年一季度这个赛道融资就有2560亿元!但现在头部公司估值已经超百亿,普通VC都投不进去了,所以钱开始往上游走,“世界模型”就是上游最火的方向之一。

为啥世界模型重要?因为具身智能要和真实世界打交道,得先“理解”世界的规律——比如杯子掉地上会碎,门推开后空间会变。而世界模型就是让AI学会这些规律的技术。

3. 世界模型到底是啥?四大路线+智源的“第五种玩法”

目前行业对世界模型没有统一定义,但智源院长王仲远把现有的技术路线分成了四类:

  • 语言型:比如能看图片说话的模型,只懂语言描述的世界,不懂物理后果(比如它知道“杯子”,但不知道掉地上会碎);
  • 像素型:比如OpenAI的Sora视频生成模型,只懂图像/视频的像素,不懂背后的规律;
  • 三维型:比如李飞飞团队搞的,能建3D空间,但只懂几何结构,不懂物理状态(比如门的形状,但不知道推开门会怎样);
  • 视觉表征型:Meta的LeCun提出的,用抽象的“中间层”学世界,但还是没触及物理规律。

智源自己搞的是第五种:把语言和视觉表征结合,用一个“抽象中间层”同时处理文字、图像等不同信息,目标是让AI真正理解物理世界的运行逻辑。

4. 智源为啥提前押注?解决机器人的“笨”问题

现有机器人有个大痛点:不会举一反三。比如它学过拿杯子,但没见过的新杯子可能就不会拿;它知道开门,但不知道门推开后里面的空间变化。为啥?因为它不懂物理规律——不知道杯子掉了会碎,门开了空间会变。

智源想做的“通用世界基座模型”,就是要解决这个问题:让AI像人一样,通过观察和互动,自主学会世界的规律(比如2岁小孩看短视频就能学会拆糖果,不用人教)。这也是智源提前布局的核心原因——抓住AI从“懂语言”到“懂世界”的转折点。

5. 世界模型能复制大模型的神话吗?还早,但潜力无限

大模型(比如ChatGPT)的成功是因为技术路线逐渐统一,形成了明确的赛道。但现在世界模型还处于“混沌期”:没有统一定义,没有标准技术路线,甚至大家说的“世界模型”可能都不是一回事。

王仲远打了个比方:现在的世界模型,就像2012年的深度学习——当时AlexNet刚火,但没人知道后来会有Transformer和ChatGPT。虽然现在还不确定它会变成啥样,但越来越多机构、资本开始关注,智源已经站在了浪潮的起点。

一句话总结

智源在大模型时代是“人才摇篮”,现在又提前布局世界模型,想让AI从“会说话”变成“懂世界”——这可能是AI下一个大爆发点,但目前还在早期探索阶段。