虎嗅

和王啸峰聊聊GigaWorld-1:当世界模型成为具身智能的物理裁判

该文章尚未提供 Español 解读,以下为中文版内容。

核心内容总结

机器人的“大脑”(如VLA模型)迭代后,真机评测效率极低(需排队、摆道具、人工观察,1-2天出结果),拖慢了具身智能的发展。极佳视界推出GigaWorld-1,用“世界模型”替代部分真机评测——先在模拟环境中快速评估模型,达标后再上真机,大幅提升迭代效率。同时,文章探讨了世界模型做裁判的技术路线(3D vs video)、评估标准,以及未来赛道的竞争核心是“系统能力”。

一、为什么要用世界模型当机器人的“裁判”?

机器人模型迭代后,真机评测就像“每次试新菜都要重新买菜、洗菜、炒一遍”——研究员得把新模型刷进机器人,摆好测试道具,守着看它执行,跑够样本才能出结果,1-2天才能知道好坏。这种低效拖慢了整个行业的进度。

世界模型的解决方案是:用算法模拟真实物理环境,先在“虚拟世界”里测模型。只有模拟得分够高,才让它上真机。这样一来,大部分不合格的模型在虚拟阶段就被淘汰,减少了真机测试的排队和时间成本。目前它还不能完全替代真机(最多90%),但能显著提升效率——比如之前模型团队要等1-2天的评测结果,现在虚拟测试几小时就能拿到反馈。

二、什么样的世界模型才能当好“裁判”?

当好裁判的核心是“模拟结果要和真机完全一致”——虚拟里成功,真机也得成功;虚拟里失败,真机也得失败(这叫“golden metric”)。但这个标准现在靠人工标注(三个人反复检查),成本高。

于是团队做了两件事:

1. 筛选有效指标:业界有50多种自动评估指标,团队找出8-10种和人工标注高度相关的,减少对人工的依赖;

2. 训练裁判模型:用大量人工标注数据训了一个多模态模型,让它替代人工判断模拟结果的好坏。

另外,现在的VLM(视觉语言模型)做不好物理评估——它的评分和真实结果甚至“负相关”(VLM说好的,真机可能失败),因为VLM对物理常识的判断能力还不够。

三、世界模型的路线之争:3D vs Video?

目前有两种技术路线,优劣势完全相反:

  • 3D路线:像搭3D游戏场景,每个物体都要建模型、摆位置、调物理属性(比如重量、硬度)。优点是物理一致性高、可解释(哪里错了能手动改);缺点是人工成本极高——换个场景(比如从厨房到卧室)就得重新搭,像“重新装修房子”。
  • Video路线:不用搭场景,只要给AI看几十条真实场景的视频(比如机器人炒菜的视频),它就能自己学会模拟。优点是数据驱动、成本低;缺点是不可解释(AI怎么模拟的藏在黑盒里,错了也难改)。

作者更看好Video路线——随着模型和数据越来越强,它会比3D更高效,就像“AI看视频学做饭,比手动搭厨房模型快多了”。

四、未来三五年,世界模型赛道拼什么?

不是拼“单一模型的跑分”,而是拼“系统能力”——从数据采集、模型训练、评测工具到商业化落地,全链条打通。

怎么算“第一梯队”?

  • 学术上:论文被引用多、GitHub星多,同行都知道你的工作;
  • 商业上:客户有需求时第一个想到你,愿意持续付费(比如像企业用Anthropic的模型一样)。

作者认为国内不会只有一家跑出来,生态需要多家竞争。

五、GigaWorld-1的实际效果和未来展望

目前GigaWorld-1已经在内部用起来了:

  • 效率提升:减少了真机测试的次数,模型团队不用再等1-2天拿结果;
  • 迭代优化:虚拟评测和真机的差距,能反过来优化世界模型,让它越来越接近真实。

未来普及到“接近真机90%效果”还需要时间,但国外(比如Physical Intelligence和NVIDIA)也在做类似的事。最终目标是让世界模型成为机器人研发的“快速试错工具”,让机器人迭代像ChatGPT一样快。

一句话总结

用世界模型当裁判,就是给机器人研发装了个“虚拟试错器”,让它不用每次都“真刀真枪”地测,大幅加快进步速度——这可能是未来具身智能突破的关键一步。