虎嗅

实测5款国产世界模型,看清“生成世界”走到了哪一步

你好!我是你的财经记者兼经济学者朋友。今天我们要聊的,不是冷冰冰的代码,而是一个正在悄悄改变我们未来生活方式的“新物种”——世界模型(World Model)。

最近,“世界模型”这个词在科技圈火得一塌糊涂。李飞飞、字节、腾讯、阿里、蚂蚁……巨头们纷纷下场。但普通人可能会问:这玩意儿到底是个啥?跟我有什么关系?现在能用吗?

为了搞清楚这个问题,我深入拆解了这篇来自《夕小瑶科技说》的深度实测文章。这篇文章没有堆砌晦涩的术语,而是像玩电子游戏一样,亲自上手测试了国内5款主流的世界模型产品。

下面,我将用大白话,把这篇硬核评测拆解成5个核心维度,带你一眼看懂“生成世界”到底走到了哪一步。

---

一、 概念拆解:世界模型不是“视频”,是“可交互的平行宇宙”

首先,我们要纠正一个最大的误区:世界模型 $\neq$ 视频生成模型。

  • 视频模型(如Sora): 像看电影。你只能看,不能动。导演拍什么,你看什么。它是线性的、固定的。
  • 世界模型: 像玩《塞尔达传说》或《我的世界》。你可以实时交互。
  • 你可以往前走、后退、转弯。
  • 你可以对世界下指令:“下雨”、“开门”、“让那只猫变超人”。
  • 核心逻辑: 下一个画面,是根据你刚才的动作和指令,实时计算并生成出来的。

通俗比喻:

如果视频模型是给你看一段“海底世界”的录像带,那世界模型就是把你扔进一个活着的海底世界。你想往左游,鱼群就散开;你想扔个石头,水花就溅起。它是持续运行、即时反馈的。

目前,国内有5家选手开放了实测:

1. 蚂蚁 LingBot-World 2.0

2. Loopit Zing-0.5

3. 阿里 HappyOyster 1.0

4. 爱诗 R1

5. 腾讯混元 HY-World 2.1

这五家的玩法其实分成了三类:

  • 漫游派: 你能走,世界跟着变(腾讯、部分阿里)。
  • 导演派: 你下指令,世界演给你看(爱诗、部分阿里)。
  • 联合控制派(最接近游戏): 你一边走,一边改世界(蚂蚁、Loopit)。

---

二、 基础能力大比拼:它能不能“记住”你是谁?

在玩游戏时,最让人崩溃的是什么?是穿模和变脸。比如你刚还是主角,转个身变成路人甲;或者你刚走两步,身后的房子消失了。

文章通过两个关键测试,揭示了各家在“一致性”上的真实水平:

1. 输入还原度(开局稳不稳?)

  • 测试: 给一张“沙漠帆车”的图,看谁能准确生成开场。
  • 结果: Zing、HappyOyster、LingBot 表现最好,基本还原了原图。
  • 翻车现场:
  • 爱诗 R1: 你给的是背影,它直接给你来个正脸特写,完全变了味。
  • 腾讯 HY-World: 直接拒收人像图,只认风景图。这说明它目前更偏向于“场景生成”,而不是“角色交互”。

2. 运动后一致性(走着走着会不会“崩”?)

这是世界模型的生死线。如果你往前走,世界不能变形、消失或乱长东西。

  • 主体一致性(人/物变没变?):
  • Zing & HappyOyster: 稳如老狗。车还是那个车,人还是那个人。
  • LingBot: 有点小毛病,车底突然冒出四个大黑轮胎,再也变不回去了。
  • 爱诗 R1: 灾难级表现。 主角在沙漠开车,脸换了三次!从背影变正脸,变戴护目镜,最后变成女性面孔。这说明它目前还无法维持角色的长期记忆。
  • 环境一致性(背景变没变?):
  • HappyOyster: 冠军。 抬头看星空,低头看村庄,再抬头,星空还在原位,没乱动。
  • Zing: 不错,但星空有点轻微变形。
  • LingBot: 翻车。转一圈回来,天上凭空多个月亮,梵高式的星空变成了蓝色横纹。

💡 记者点评:

目前,阿里 HappyOyster 在“保持世界稳定”方面做得最好,适合做沉浸式体验;Loopit Zing 紧随其后;蚂蚁 LingBot 和 爱诗 R1 在长距离交互中容易“失忆”,还需要大量优化。

---

三、 物理与逻辑:它懂不懂“常识”?

世界模型不仅要好看,还得讲道理。如果海啸是从船顶流下来的,那这游戏没法玩。

文章测试了两个物理场景:

1. 海啸来袭

  • 指令: “海啸来袭”。
  • Zing: 海浪从海面涌起,扑向栈桥,符合物理规律。
  • LingBot: 水像瀑布一样从船顶往下淌,旁边海面还是平的。这就像在现实里,水突然从天花板漏下来淹了你,非常诡异。

2. 天亮过程

  • 指令: “天亮了”。
  • Zing: 天空和海面逐渐变亮,光影过渡自然,像真实的日出。
  • LingBot: 变化不明显,有点“假”。

💡 记者点评:

Zing 在物理逻辑上目前领先。它生成的世界更像是一个有规则的运行系统,而不是单纯的视觉特效堆砌。这对于未来做游戏、模拟训练至关重要——如果物理不对,用户就不会信。

---

四、 核心玩法:是“看戏”还是“玩游戏”?

这是区分“高级视频”和“世界模型”的关键。文章将能力分为导演和联合控制。

1. 导演能力(AI自己演)

  • 爱诗 R1: 像个天马行空的编剧。画面很炫,创意十足,但经常“飞了”。比如让它演小猫走路,它演着演着,猫背上长出了蝴蝶翅膀,或者突然冒出铁链石台,故事线混乱。
  • 阿里 HappyOyster: 像个专业的导演。镜头语言很好,知道什么时候切特写,什么时候拉全景。比如小猫走路,它会先拍爪子落地,花开了,再拉远看全景。叙事逻辑清晰,体验感最好。

2. 联合控制(你边玩边改)

这是最接近未来游戏的能力。

  • 场景: 你控制角色打龙,同时让环境变化。
  • Zing: 表现优秀。你一边往前走,一边发射光束打龙,镜头能看清你和龙的位置关系。它保留了“行动所需的信息”,让你知道下一步该干嘛。
  • LingBot: 特效太满。蓝色光环、紫色火焰挡住视线,你根本看不清自己在打谁。它更像是在展示“特效”,而不是让你“玩游戏”。

💡 记者点评:

  • 如果你想看故事,选 HappyOyster(阿里)。
  • 如果你想玩游戏/互动,选 Zing(Loopit)。
  • LingBot(蚂蚁)目前特效华丽,但容易喧宾夺主,干扰操作。

---

五、 商业落地:快不快?贵不贵?

技术再好,如果卡顿或者太贵,普通人根本用不起。

1. 响应速度(跟手吗?)

  • Zing: 对环境变化(如雷雨云)响应最快。你刚下指令,世界马上变。
  • LingBot: 对人物动作(如转身)响应很快,很跟手。
  • 爱诗 R1: 比较慢,下指令后要等几秒画面才变。
  • HappyOyster: 漫游操作很跟手,但不能同时下指令。

结论: Zing 在“即时反馈”上体验最好,最接近真实游戏的流畅度。

2. 成本(钱包疼不疼?)

这是最现实的经济学问题。文章对比了10分钟的使用成本:

| 产品 | 10分钟成本 | 备注 |

| :--- | :--- | :--- |

| Loopit Zing | < 1元人民币 | 这是推理成本(服务器电费+算力),不是用户账单。如果按此定价,极具竞争力。 |

| 蚂蚁 LingBot | ~2美元 (~15元) | 公开报价,连接10分钟。 |

| 阿里 HappyOyster | ~10.4美元 (~75元) | 包含“建世界”费用+实时会话费。最贵。 |

| 腾讯/爱诗 | 数据缺失或计费方式不同 | 腾讯按生成结果买,爱诗无可比数据。 |

💡 记者点评:

  • Zing 的成本优势巨大。如果它能把推理成本控制在1块钱以内,并以此定价,它将拥有极强的普及潜力。
  • HappyOyster 因为包含“建世界”的高昂成本,目前更像是一个高端定制服务,适合专业创作者,而非大众玩家。

---

📝 总结:世界模型走到哪一步了?

用经济学的视角来看,世界模型目前处于“GPT-3时刻”。

  • 它不是 ChatGPT: 还没有达到那种“开箱即用、完美无缺、人人可用”的成熟度。
  • 它是 GPT-3: 技术路线已经跑通,能力已经成立,你能明显感觉到“这条路是对的”,但体验还需要打磨,Bug还不少。

给普通人的建议:

1. 别指望现在就能玩大作: 目前的产品还是“研究预览版”,普通用户体感不强,Bug多(变脸、穿模)。

2. 关注“联合控制”能力: 这是世界模型区别于视频模型的核心。未来谁能把“边走边改”做得流畅、便宜,谁就能赢。

3. 看好阿里和Loopit:

  • 阿里 HappyOyster 胜在叙事和稳定性,适合做影视、互动剧。
  • Loopit Zing 胜在交互性和低成本,适合做游戏原型、实时互动。

最后的一句话:

世界模型不再是科幻,它正在变成一种新的创作工具。虽然现在还有点“抽卡”(随机性大),但它已经让我们摸到了“实时生成世界”的门槛。接下来,我们要看的不是它能不能生成画面,而是它能不能让我们愿意一直留在里面玩下去。