核心内容总结
00后北大毕业生陈博远创立的AI公司逆矩阵,专注研发“通用世界基座模型”(Physis)——让AI真正理解物理规律(如重力、因果),能跨场景解决工业、具身智能等真实物理问题。团队成立不久就获高瓴等千万美元投资,当前估值超50亿元,即将完成过亿美元融资。陈博远同时担任智源研究院行为世界模型创新中心负责人,与智源联合推进技术落地。他们的模型区别于行业内“只做垂类场景”的世界模型,通过物理隐空间学习、交互验证等独特路径,试图打造AI进入真实物理世界的基础设施。
一、00后团队的“硬核”融资:估值50亿背后,是踏实做技术的底气
逆矩阵的创始人陈博远是刚毕业的北大元培学生,早在读书时就凭强化学习研究拿过国际顶会ACL最佳论文(和DeepSeek团队同期获奖)。2026年初(尚未毕业时)创立公司,首轮就拿到高瓴和北大系基金超千万美元投资,现在估值超50亿,是00后AI团队里估值最高的之一。
但他们并不急着融资:“我们希望踏实做技术第一性突破”。这也是他们和智源研究院合作的原因——智源更看重研究而非商业化,之前孵化过智谱AI(已上市)、月之暗面等百亿估值公司。陈博远以逆矩阵创始人身份兼任智源创新中心负责人,两边互相赋能:逆矩阵做前沿探索,智源把验证过的技术放大到通用场景。
二、通用世界基座模型:让AI从“看视频”到“懂物理”
现在行业里很多公司都在说“世界模型”,但大多停留在“表面功夫”:比如生成流畅视频(像OpenAI的Sora)、做游戏交互(谷歌Genie),这些本质上是“W0/W1级”——只能解决影视、游戏等内容问题。
逆矩阵要做的是“W2+级”通用世界基座模型:真正懂物理规律。比如工业产线里的机械臂操作、自动驾驶里的碰撞预测,这些场景需要AI理解“重力、接触、因果”等硬约束。他们的目标是:用一套模型解决所有物理场景问题,就像ChatGPT能同时处理金融、法律任务一样——不同场景背后的物理规律是通用的(比如重力不会因为场景变而变)。
三、技术卡脖子?他们走了一条和ChatGPT不一样的路
ChatGPT靠“堆数据、堆参数”成功,但世界模型不能直接抄这条路,因为有三个卡点:
1. 物理数据不够:互联网文本能无限爬,但真实物理数据(比如机械臂操作、玻璃破碎)很难大量采集;
2. 像素≠物理:视频里90%是纹理、光照,和物理规律无关,模型学这些会浪费参数;
3. 相关性≠因果:ChatGPT学的是“统计关联”(比如“下雨”和“打伞”一起出现),但物理需要“因果”(比如“推杯子”导致“杯子倒”)。
逆矩阵的解决方法:
- 物理隐空间学习:让模型跳过表面像素,直接学抽象的物理本质(比如看到杯子倒,就知道水会洒,不用看每个像素);
- 引入Action交互:模型不能只“看世界”,还要“动手”——比如模拟“推杯子”的动作,预测结果;
- 强化学习验证:像数学题有标准答案一样,物理规律也可验证(比如物体不会凭空消失),用强化学习让模型不断修正错误。
他们内部已经看到:随着数据和交互增加,模型的物理预测误差持续下降,甚至出现“涌现”能力——就像ChatGPT的GPT-3时刻,未来世界模型也会有自己的爆发点。
四、数据不够?他们用“三层金字塔”和仿真造数据
物理数据少怎么办?逆矩阵搭了个“数据金字塔”:
1. 底层:学状态(比如水会流、玻璃会碎):用大量真实视频和复杂交互数据;
2. 中层:学因果(动作→状态):重点用第一人称数据(比如“我推杯子”的视角),因为它天然带“动作导致结果”的因果关系;
3. 顶层:学长尾规律(比如玻璃爆炸、物体遮挡):用仿真引擎生成这些真实世界难采集的场景(比如在虚拟环境里反复模拟“杯子倒”)。
数据比例上,第一人称和多视角(外部观察)是9:1甚至100:1——因为第一人称数据更能帮模型学因果。他们还发现:跨场景数据能让垂类场景的数据需求减少20倍,效果反而更好(比如学了游戏里的物理,也能用到工业场景)。
五、不只是00后的时代,更是Physical AI的未来
逆矩阵团队平均年龄是00后,但陈博远说:“Physical AI属于所有相信这个方向、愿意长期投入的人”。
为什么Physical AI重要?因为AGI(通用人工智能)的下一步必须进入真实物理世界:过去的大模型只会处理文字、图像,未来的AI要能操作机器人、做工业仿真、预测科学实验(比如可控核聚变)。这些都和国家“新质生产力”相关——低空经济、商业航天、智能制造等,都需要AI懂物理规律。
逆矩阵的目标不是做一个服务某行业的垂类模型,而是打造面向整个物理世界的“基础设施”——就像 electricity(电力)一样,支撑所有实体产业的AI应用。
这篇新闻让我们看到:00后团队正在用底层创新,推动AI从“虚拟”走向“真实”,而Physical AI可能是下一个改变世界的技术浪潮。