虎嗅

GPT-6 来了,我们和多个局内人聊具身智能的护城河与暗礁

GPT-6 来了,具身智能的“护城河”还在吗?——一场关于焦虑、机会与底层的深度拆解

大家好,我是你们的财经记者。最近科技圈炸了个锅,OpenAI 发布了 GPT-6 的 Astra 版本,并且明确表态要做人形机器人。这就像是一个拿着“屠龙刀”的巨人,突然说:“我要去种地了。”

对于正在辛苦种地(做机器人硬件和算法)的具身智能创业公司来说,这不仅是压力,更是一种存在主义的危机:如果 AI 足够聪明,它是不是就不需要专门的“机器人专家”了?我的饭碗会不会被抢走?

今天,我们就结合外滩大会上多位行业大佬(如极佳视界朱政、蚂蚁灵波朱兴、自变量王潜等)的观点,用大白话把这件事掰开了、揉碎了,给大家讲清楚:GPT-6 到底带来了什么?具身智能的护城河到底在哪里?我们该慌还是该稳?

---

一、 狼真的来了:为什么大家突然开始“焦虑”?

首先,我们要承认,这次焦虑是有实打实的理由的,不是空穴来风。

1. “降维打击”的既视感

以前大家觉得,做语言模型(ChatGPT 这类)和做机器人(具身智能)是两码事。但现在,GPT-6 Astra 不仅能聊天,还能直接控制机械臂。演示视频里,它抓筷子、插杯子,做得有模有样。

极佳视界的朱政说得很直白:“狼已经来了,放弃幻想。”他的逻辑是:语言模型已经“吃掉”了多模态(看图、听音),现在正在蚕食具身智能。而且,OpenAI 这种巨头在人才、算力、资金上全面碾压创业公司。如果它们决定亲自下场,创业公司很难招架。

2. 时间窗口的紧迫性

朱政认为,未来一两年是关键窗口期。今天的具身智能公司,还没有建立起真正的、别人抄不走的“护城河”。如果巨头现在入场,凭借强大的通用认知能力,可能会迅速抹平技术差距,让还在打磨第一代产品的创业公司直接出局。

3. 情绪的本质:怕被“提前兑现”

这种焦虑的核心在于:具身智能的价值,原本需要创业公司花几年时间去验证和实现。但现在,上游的大模型公司可能通过发布一个更强的模型,直接把这个价值“提前兑现”了,而且收益归它们所有。这就好比,你辛苦研发了一款新药,结果大厂直接发布了一个通用药方,把你的药给替代了。

---

二、 别急着哭:大模型进物理世界,没那么容易

虽然焦虑很真实,但同一场大会上,也有声音在冷静泼冷水。蚂蚁灵波的朱兴和自变量的王潜提出了一个非常犀利的反问:OpenAI 这么强,为什么不去做自动驾驶,吃掉特斯拉?

1. “懂道理”不等于“会干活”

语言模型擅长的是“语义”和“逻辑”,比如知道“杯子”是什么,知道“把杯子放到桌子上”这个指令的含义。但是,物理世界是复杂的、动态的、充满摩擦力的。

  • 语义层(大脑):知道东西在哪,该往哪送。GPT-6 很强。
  • 物理层(手脚):知道怎么用力,怎么调整角度,怎么应对物体滑落。这是 GPT-6 目前的短板。

2. 数据与验证的鸿沟

王潜指出,语言模型的进步,背后是海量的编程数据和完善的验证体系。视频生成有进展,也没直接解决机器人动作控制的问题。

大模型公司进入物理世界,同样需要补齐基础设施:

  • 真实数据:机器人在真实世界里摔倒、抓取失败的数据,大模型公司没有。
  • 硬件适配:不同的机械臂、不同的传感器,需要不同的控制策略。
  • 验证体系:怎么证明机器人真的做对了?这需要一套复杂的评测系统。

3. 产业能力的距离

朱兴用自动驾驶做类比:模型能力领先,不能省去对场景的理解,也不能直接换来成熟的数据管线。判断什么是“好数据”,积累数据的“Know-how(诀窍)”,才是更具壁垒的工作。

简单来说,OpenAI 有最强的“大脑”,但它没有最灵活的“身体”,也没有在泥泞中摸爬滚打的“经验”。

---

三、 拆解真相:GPT-6 到底能干什么?不能干什么?

为了搞清楚 GPT-6 在具身智能里的真实地位,破壳机器人的许华哲和 RoboDojo 的研究团队做了一些非常具体的测试。结果很有意思,既不是“神”,也不是“废柴”,而是一个“强大的顾问”。

1. 强项:语义与空间理解(“看”和“想”)

在测试中,Astra 表现非常出色:

  • 它能识别桌面上的物体。
  • 它能抓起细小的筷子,甚至能把筷子立起来插入杯子。
  • 它能规划“推”、“拨”等非抓取操作。

这说明,GPT-6 在“知道该做什么”和“理解空间关系”方面,已经非常强大。

2. 弱项:复杂接触与精细操作(“做”和“控”)

一旦任务变得复杂,比如:

  • 用筷子挑开东西。
  • 叠衣服。
  • 双手递物。

Astra 的表现就不理想了,成功率很低。

原因:物理交互中有很多“不可见”的变量,比如摩擦力、物体的弹性、重心的微小变化。这些无法仅凭外观(视觉)确定,必须通过实际的触觉反馈和实时调整来解决。

3. 关键数据:混合架构才是王道

RoboDojo 的研究显示了一个关键数据:

  • 纯 GPT-6 Astra 直接控制:成功率 26%。
  • GPT-6 Astra + 专用具身模型(π₀.₅)混合控制:成功率 48%。
  • 细节:在混合架构中,GPT-6 只修正了 14.4% 的动作,其余 85.6% 的动作是由底层具身模型完成的。

解读:

这证明了“通用推理 + 局部操作经验”的结合才是当前最优解。GPT-6 负责高层规划(比如“先拿杯子,再拿勺子”),底层模型负责具体执行(比如“手指怎么发力”)。

结论:GPT-6 没有“解决”具身智能,但它极大地提升了系统的上限。它像一个经验丰富的指挥官,但士兵(底层控制模型)依然不可或缺。

---

四、 护城河在哪里?从“数据”到“闭环”的重新定义

既然 GPT-6 这么强,那具身智能公司的护城河到底在哪?以前大家说“我有数据”,现在这个说法需要打折扣了。

1. “数据壁垒”正在被稀释

源策未来的李天羽分享了一个趋势:他们已经开始用 GPT-6 来生成仿真场景。

  • 以前:搭建一个 3D 仿真场景,需要大量人工建模,成本高,周期长。
  • 现在:GPT-6 可以通过编程快速生成逻辑合理、完整的 3D 场景资产。

这意味着,“拥有数据”不再稀缺,因为数据的生产成本在降低。 原来靠“堆数据”建立的优势,正在被通用模型的工具能力所侵蚀。

2. 真正的壁垒:持续发现问题的能力

既然数据容易获取,那什么难获取?

  • 知道机器人在哪些情况下容易失败。
  • 能够进入对应场景采集“失败”数据。
  • 能从失败中识别真正缺失的信息。
  • 通过训练和评测确认改进。

这才是核心。大模型公司可能擅长“批量生产”数据,但具身智能公司擅长“在真实世界中踩坑”。

护城河不再是“我有多少数据”,而是“我有一套闭环系统,能不断从失败中学习,并转化为更可靠的产品”。

3. 物理原生 vs. 语义微调

蚂蚁灵波的沈宇军和影身智能的闵伟都强调了一个概念:“物理原生”。

  • 旧路径:在语言模型(VLM)或视频模型(Video Gen)的基础上微调,得到具身模型。
  • 风险:如果基座模型(如 GPT-6)能力跃迁,你的微调模型就会瞬间过时,被“降维打击”。
  • 新路径:开发基于物理规律、空间变化(如 4D 世界模型)的原生模型。

比喻:旧路径像是在沙滩上盖房子,海水(基座模型)一涨就没了;新路径是在岩石上盖房子,虽然难,但稳。

---

五、 未来格局:不是“谁吃掉谁”,而是“共生与分工”

最后,我们要跳出“零和博弈”的思维。GPT-6 的出现,并不意味着具身智能行业的终结,而是行业分工的重组。

1. 基础设施 vs. 应用交付

影身智能的闵伟认为,未来的 OpenAI 可能更像“水电网”一样的基础设施提供者。

  • OpenAI/Anthropic:提供强大的通用认知能力(大脑),作为底层 API 或基座模型。
  • 具身智能公司:负责具体的硬件集成、场景适配、物理交互优化、售后服务。

商业逻辑:一款落地的机器人产品里,大模型语义能力占比可能不足一半,剩下的核心价值来自物理规律理解、机械工程和复杂场景交互。这些是“脏活累活”,巨头未必愿意做,也没法完全外包。

2. 反向赋能:机器人让 AI 更聪明

沈宇军提出了一个反向观点:具身智能可能反过来影响大模型。

机器人通过传感器持续感受环境,这些物理世界的真实反馈,是纯数字世界模型缺乏的宝贵学习材料。

  • 机器人摔倒的数据,可以教 AI 理解重力。
  • 机器人抓取失败的数据,可以教 AI 理解摩擦力。

结论:物理世界为 AI 提供了新的进化路径。具身智能公司不仅是 AI 的应用者,也是 AI 进化的“养料提供者”。

3. 竞争指标的变化

未来的竞争,不再是比“谁的模型参数大”,而是比:

  • 谁能用更少的交互经验,达到更高的成功率?
  • 谁的部署成本更低?
  • 谁能在现场异常处理、维护成本控制上做得更好?
  • 谁能形成“部署-反馈-优化”的快速飞轮?

---

总结:给普通人和从业者的建议

1. 对于投资者:不要盲目追捧“纯软件”的具身智能概念,也不要因为 GPT-6 的出现就全盘否定硬件公司。关注那些拥有真实场景数据闭环、具备物理原生模型研发能力、且能控制交付成本的公司。

2. 对于创业者:

  • 别幻想靠“微调”大模型就能活下来,那是一条死胡同。
  • 深耕物理层:把精力花在传感器融合、机械结构优化、真实世界数据采集和失败案例分析上。
  • 拥抱工具:利用 GPT-6 等工具降低仿真和数据清洗成本,把省下来的资源投入到更核心的物理交互研究中。
  • 建立闭环:你的护城河不是数据本身,而是你从数据中提炼出“物理直觉”的能力。

3. 对于普通人:GPT-6 不会让机器人瞬间普及,但它会让机器人变得更聪明、更便宜。未来几年,我们会看到更多“半自动”的机器人进入工厂和家庭,它们可能还会犯错,但会越来越靠谱。

一句话总结:

GPT-6 是具身智能的“加速器”,而不是“终结者”。它缩短了行业证明价值的时间,但也拉高了门槛。边界仍在移动,但谁能在这之前,把“物理世界的复杂性”转化为“别人难以复制的产品力”,谁就能守住自己的地盘。