虎嗅

从打球机器人,看Physical AI 的路线之争

核心内容总结

这篇文章通过分析MIT、DeepMind、Berkeley、银河通用、Sony AI等团队的打球机器人技术,揭示了Physical AI(物理智能)领域的核心路线之争:不是物理模型与机器学习谁替代谁,而是两者如何分工协作。物理模型负责提供稳定、低成本的“已知知识”(如重力、球的基本运动规律),机器学习则处理高维、复杂的“未知技能”(如人形机器人全身协调击球)。不同团队的方案本质是在重新分配两者的职责——从直接用模型控制,到用模型构建仿真环境训练,再到用模型定义“可能的世界范围”,最终形成“物理提供骨架、学习填充细节”的混合模式。

详细拆解解读

1. 打球机器人:为什么它是技术路线的“放大镜”?

打球看似简单,实则把机器人的核心难题压缩到了极致:

  • 反应时间极短:乒乓球速度超20m/s,两次击球间隔不到0.5秒,机器人必须提前预测球的落点,等球到面前再反应就晚了;
  • 动态变化复杂:球的旋转(如1000rad/s的转速)会改变飞行轨迹和碰撞结果,空气阻力、地面摩擦也不能忽略;
  • 全身协调难:人形机器人打网球时,要同时控制腿(移动)、腰(转体)、肩(挥拍)等20多个关节,还要保持平衡,同一个击球目标可能有几十种身体姿态可选。

这些问题让“模型vs学习”的矛盾暴露无遗:用模型算所有细节太复杂,纯学习又容易出错——所以打球机器人成了观察技术路线的最佳样本。

2. 物理模型的“搬家史”:从控制环到仿真,再到定义边界

物理模型并没有消失,只是在系统中的位置不断变化:

  • MIT:直接用模型控制(2025年乒乓球机械臂):机器人每接一个球,都用物理公式算球的未来轨迹,再规划挥拍动作(像工程师手把手教每一步);
  • DeepMind:模型藏在仿真里(2024年竞技乒乓球系统):机器人不在真实世界练,而是在虚拟环境(按物理规律搭建)里练几百万次,练出“肌肉记忆”后再到真实世界打(模型负责造虚拟训练场);
  • Berkeley HITTER:分层分工(2025年人形乒乓球机器人):上层用模型算球的落点和球拍目标,下层让机器人自己学怎么动身体(球的规律用模型,身体动作学);
  • 银河通用LATENT:模型定义“可能的世界”(2026年网球机器人):虚拟训练时故意让球的重量、地面摩擦、空气阻力在合理范围随机变化,机器人练会适应各种情况(模型不再追求精确,而是给“容错空间”);
  • Sony Ace:混合模式(2026年Nature论文):核心用机器学习,但仍保留物理仿真训练、球旋转估计、碰撞约束优化(学习为主,模型补漏)。

3. 物理模型为啥没被淘汰?因为“知识复用”太划算

物理模型的核心价值是提供“便宜的先验知识”:

  • 比如重力,写一个公式(F=mg)几乎零成本,但让机器人通过摔十万次球才发现“球会掉下来”,要花大量数据和算力;
  • 再比如球的飞行轨迹,用牛顿运动定律算比让模型从视频里学快得多。

这些稳定、通用的规律,直接“告诉”机器人比让它重新学更经济——就像你不会让孩子重新发明“1+1=2”,而是直接教给他。

4. 路线之争的真相:不是谁替代谁,而是“分工算账”

本质是经济学问题:对某部分能力,用方程、数据还是算力更便宜?

  • 方程优先:稳定、简单、表达成本低的规律(如重力、球的基本运动);
  • 学习优先:高维、复杂、难以枚举的行为(如人形机器人全身击球动作);
  • 混合模式:介于两者之间的(如球的复杂旋转,用模型加真实数据修正)。

比如HITTER的分层:球的轨迹用模型(便宜),身体动作学(划算);LATENT的随机化:模型定义参数范围(避免重复标定),学习适应变化(鲁棒性高)。

5. 通用机器人的未来:鲁棒性比精确性更重要?

通用机器人要进入不同环境(家庭、工厂、户外),不可能每次都精确标定参数(比如地面摩擦、球的磨损)。所以:

  • 不再追求“绝对精确”:像LATENT那样,让机器人适应“可能的世界”比追求一个完美的虚拟复制更实用;
  • 分工持续优化:随数据和算力增长,今天需要手写的模块(如复杂接触)未来可能被学习替代;今天靠学习的部分(如安全约束)未来可能加模型保障。

最终,Physical AI会收敛到“物理提供骨架,学习填充细节”的模式——既不抛弃已知规律,也充分利用机器学习的灵活性。

一句话总结

打球机器人的技术演变,本质是人类在不断思考:哪些知识值得直接告诉机器,哪些该让它自己探索。物理模型和机器学习不是对手,而是搭档,共同让机器人更聪明、更适应真实世界。