核心内容总结
物理AI正成为智能驾驶的下一个革命浪潮——它让AI从数字世界的“思考”(比如生成文本视频)转向物理世界的“行动”(比如理解现实中的因果关系并主动决策)。2026年被称为“物理AI元年”,智能驾驶行业正从早期的模块化割裂、应激反应式驾驶,向端到端融合、能预测未来的“超越人类智能”模式演进;技术路线从单一的VLA(视觉-语言-行动)或世界模型,转向两者深度融合;竞争逻辑也从“堆配置”(比激光雷达数量、算力参数)变为“建底座”(比拼物理世界的理解与行动能力)。不过,当前智驾离真正的物理AI终极形态还有距离,面临数据量不足、算力需求大等挑战。
一、物理AI:智驾从“看世界”到“懂世界”的跃迁
物理AI和我们之前听说的数字AI有啥不一样?简单说,数字AI是“虚拟世界的玩家”——比如ChatGPT生成文字、Midjourney画图片,都在数字空间里折腾;而物理AI是“现实世界的行动者”——它让机器能理解现实中的物体运动、因果关系,然后主动做出反应。
举个例子:以前的智驾可能看到红灯就刹车(这叫“看见什么做什么”),但物理AI能预测“前面的车突然变道,后面的车可能会急刹”,然后提前减速(这叫“想象接下来会发生,再主动行动”)。
为啥物理AI是风口?老黄(英伟达CEO)说它是继数字AI之后的“万亿级增长浪潮”,而且Momenta R7量产、宇树机器人出货这些案例,都说明AI已经从虚拟转向现实。对智驾来说,物理AI解决了一个核心问题:之前的系统像“没常识的机器人”,现在终于能像人一样有“物理直觉”了。
二、智驾技术路线:从“昆虫智能”到“端到端融合”
智能驾驶的进化史,其实是“让机器越来越像人”的过程:
1. 早期“昆虫智能”阶段:依赖规则和高精地图,比如“看到限速牌就减速”“按照地图路线走”。这种模式像昆虫——只会应激反应,不会灵活应对突发情况(比如路上突然窜出一只猫)。而且感知、决策、控制是分开的模块,中间容易出误差(比如感知到障碍物,决策模块没反应过来)。
2. 端到端革命:2024年特斯拉FSD V12是转折点,它把感知、决策、控制整合到一个神经网络里,去掉了30万行手写代码。简单说,就是“眼睛看到图像→直接输出方向盘/油门指令”,中间不用分步骤处理。国内厂商跟着学,2024-2025年分段式端到端落地,2025-2026年一段式端到端成为主流。
3. 从“黑箱”到“可解释”:早期端到端是“黑箱”——机器为啥刹车你说不清,事故后难追责。于是有了VLA(视觉-语言-行动):它把视觉信息转成文字(比如“前方有行人横穿马路”),再决策,这样逻辑能解释。但VLA有个问题:太重视文字理解,反而忽略了驾驶本身(像“背题库的学生”,遇到新题就懵)。
后来大家发现,光有VLA不够,还得加“世界模型”——给车装个能模拟现实规律的大脑,比如预测“前面的车会左转”“雨天路滑刹车距离变长”。现在行业共识是:VLA负责“理解当下”,世界模型负责“预测未来”,两者融合才是终极方案。
三、行业大转向:VLA+世界模型成主流选择
之前业内有“VLA派”和“世界模型派”之争:
- Momenta和华为早期是世界模型派:曹旭东说VLA“好钢没用在刀刃上”,靳玉志认为VLA像“背题库”,不如世界模型能真正理解物理世界。
- 小鹏曾是VLA派,但2026年也转向融合:他们的X-Mind把世界模型当“视觉思维链”,让机器在行动前先推演“接下来会发生啥”。
特斯拉FSD V14彻底改变了争论——它把xAI的Grok大模型(VLA相关)和世界模型融合,用世界模型生成仿真数据训练。现在几乎所有头部厂商都跟进:蔚来推送了世界模型架构,地平线HSD V2.0用“世界模型+端到端强化学习”,理想合并了基座模型团队支撑智驾、座舱、机器人三大业务。
一句话:现在不是“二选一”,而是“我全都要”。
四、竞争逻辑变了:从“堆配置”到“建底座”
以前汽车行业比啥?比激光雷达数量(比如“我有3颗”)、芯片算力(“我的算力1000TOPS”)、续航里程——这叫“堆配置”。但物理AI时代,比的是“谁能建出最好的物理世界基座模型”。
为啥?因为这个基座模型是“万能底座”:特斯拉用同一个模型驱动FSD(智驾)、Optimus(人形机器人);理想用它支撑智驾、座舱、机器人;高通把汽车和机器人放进同一个事业群。谁掌握了这个底座,谁就掌握了价值链的主导权。
现在头部厂商都在砸钱建底座:华为2026年智驾研发投入超180亿,未来5年再砸700亿搞算力;特斯拉有23万张H100等效算力;小鹏Robotaxi车端算力达3000TOPS。算力竞赛已经进入白热化。
五、离终极智驾还有多远?三大挑战待解
虽然物理AI是风口,但离真正的“无人驾驶”还有很长路要走:
1. 数据量不够:世界模型需要海量真实数据训练。特斯拉FSD车队累计行驶100亿英里(约160亿公里),其他新势力只有数十亿公里,差得远。
2. 算力需求巨大:物理AI模型比大语言模型更吃算力,头部厂商都在疯狂堆算力,但中小厂商可能跟不上。
3. 莫拉维克悖论:这是个经典问题——AI做复杂推理(如下棋)很容易,但像婴儿一样感知物理世界(比如判断“这个杯子会不会倒”)却极难。现在的智驾系统还是缺乏这种“物理直觉”,这也是很多人不敢完全放手的原因。
2026年是物理AI元年,但终极智驾的到来,还需要时间。
写在最后:物理AI让智驾从“模仿人类”走向“超越人类”,但它不是一蹴而就的。未来几年,我们会看到越来越多融合VLA和世界模型的智驾系统上车,但要真正实现“无人驾驶”,还得解决数据、算力和物理直觉这三大难题。不过,这场革命已经开始,我们离“不用自己开车”的日子,又近了一步。