虎嗅

腾讯、阿里、字节,为什么都在给Agent“造世界”?

腾讯、阿里、字节都在给AI“造世界”?这背后藏着AI下半场的生死局

大家好,我是你们的财经记者。今天我们要聊一个听起来有点科幻,但其实正在深刻改变科技行业格局的话题:为什么腾讯、阿里、字节跳动,甚至海外的OpenAI和Anthropic,都在疯狂地给AI Agent(智能体)“造世界”?

如果你关注AI新闻,可能会觉得最近大模型都在比谁更聪明、谁回答得更快。但这次不一样,巨头们正在卷一个更底层、更硬核的东西——“环境”。

为了让大家听得明明白白,我先把这篇来自《甲子光年》的深度报道核心内容总结一下,然后拆解成五个方面,用大白话给你讲透这背后的逻辑和机会。

📝 核心内容总结

简单来说,AI的发展进入了“下半场”。上半场比的是“解题能力”(比如写代码、写文章),下半场比的是“定义问题的能力”和“在复杂现实中干活的能力”。

要让AI像人一样去执行复杂任务(比如修Bug、订机票、管理数据库),光靠喂它一堆文字资料(静态数据)是不够的。它需要一个可以互动、可以试错、有真实反馈的“训练场”或“考场”,也就是所谓的“环境”。

目前,腾讯混元、阿里通义、字节Seed以及海外的巨头们,都在投入巨大资源构建这些“虚拟世界”。这不仅是一场技术竞赛,更催生了一个新的基础设施市场——谁能提供高质量、大规模、可进化的“AI训练环境”,谁就可能成为AI时代的“新Scale AI”(数据标注巨头)。

---

🔍 深度拆解:五个维度看懂“造世界”

1. 为什么突然要“造世界”?因为AI要开始“干活”了

以前我们跟AI聊天,它像个百科全书,你问它答,它不需要“动手”。但现在,我们要让AI去执行任务。

想象一下,你让一个实习生去排查一个软件故障。你不能只给他看一本《故障排查手册》(这是静态数据),你得给他一台电脑、一个代码仓库、一个运行环境,让他去点按钮、看报错、改代码、再运行。这个过程里,他需要看到“我做了这个操作,系统发生了什么变化”。

这就是Agent(智能体)需要的东西。

腾讯首席AI科学家姚顺雨说得很直白:“如果没有好的环境,Agent就没办法去做各种各样的事情。”

过去半年,腾讯混元团队发布了6篇关于“环境”的论文。他们发现,以前的训练数据是“死”的文档,现在的训练数据必须是“活”的交互过程。比如,AI不仅要知道怎么写代码,还要知道代码运行后数据库变了什么,报错信息长什么样。

通俗点说: 以前是教AI“背菜谱”,现在是让AI“进厨房炒菜”。你得给它真锅、真火、真食材,它才能学会火候和调味。

2. 腾讯混元是怎么“造”的?四路人马,各显神通

腾讯混元这次动作很大,至少有四组不同的团队在同时推进,而且方向非常具体:

  • 第一拨:把任务做长(Long-Horizon)

以前的测试任务可能几分钟就完了,太简单。混元团队推出了“Long-Horizon-Terminal-Bench”,把任务拉长到几小时。比如,不是让你写个“Hello World”,而是让你部署一整个后端服务。更厉害的是,他们通过自动化手段生成了3.7万个这样的长任务,平均每个成本只要5美分。这说明“造世界”可以规模化、低成本化。

  • 第二拨:把环境搬上手机(Mobile)

混元视觉团队搞了个叫“PhoneWorld”的东西,里面有34个模拟的App(比如腾讯健康、地图等)。AI要在里面预约疫苗、跨App调度。这模拟的是我们在手机上真实操作的过程。

  • 第三拨:让环境“进化”(Evolution)

这是最关键的洞察。如果环境太简单,AI刷几个版本就“摸透”了,学不到新东西。于是,混元团队不再从零造环境,而是让环境自动升级。比如,原本只是写个静态网页,后来升级成要部署、要动态维护、要处理并发。环境跟着AI的能力一起变难,确保AI永远有东西可学。

  • 第四拨:接入生产线(Pipeline)

他们把“生成任务”、“搭建沙箱”、“验证结果”这些步骤自动化,直接接入到AI的训练流水线里。这意味着,AI在训练时,可以实时地在这些虚拟世界里练习,而不是事后补课。

注意一个细节: 腾讯内部还发生了组织调整,把大语言模型和多模态模型合并,由姚顺雨统一负责,并且明确把“强化学习及Agent能力”写进职责。这说明,“造环境”不是某个小团队的自嗨,而是公司级的战略重心。

3. 阿里和字节也在卷,而且卷得更“狠”

腾讯不是孤例,阿里和字节也在同一时间点上发力,而且思路各有特色。

  • 阿里通义:直接命名“Environment Scaling”

阿里联合浙大、北大的论文直接把标题定为《Towards General Agentic Intelligence via Environment Scaling》(通过环境扩展实现通用智能体智能)。阿里首席科学家周靖人也是作者之一。

他们的核心观点是:你见过的环境越丰富,你以后能处理的工具就越多。 就像一个人去过的城市越多,他的世界观越开阔。阿里甚至构建了80多万个可验证的软件工程环境,规模惊人。

  • 字节Seed:环境跟着模型“长”

字节和人大团队搞了个“Agent-World”,里面有2000多个环境、1.9万个工具。他们的特点是动态生成。如果AI在某个地方卡住了,或者暴露出能力缺口,系统就自动生成新的、针对性的任务来训练它。这就像老师看着学生的错题本,专门出类似的题来练。

共同点: 大家都在从“静态数据”转向“动态交互环境”。而且,大家都在解决一个痛点:高质量环境太难造了。

4. 最大的坑:99.7%的环境是“垃圾”,怎么破?

这是整篇文章里最让人警醒的数据。

腾讯混元团队从GitHub和Hugging Face上收集了47,678个公开的终端环境。经过严格筛选(检查有没有Bug、难度是否合适、标准是否清晰),最后只留下了127个。

淘汰率高达99.7%!

为什么?

1. 质量差: 很多环境本身就有Bug,或者测试标准不一致。

2. 太简单或太假: 小模型本来就不会做,无所谓;但大模型很聪明,如果环境有漏洞,它会直接“钻空子”(Hack)来通过测试,而不是真正学会解决问题。这就好比考试题目出错了,学生靠蒙也能拿高分,但这不代表他学会了。

3. 不稳定: OpenAI和Anthropic也发现,同样的任务,在不同的电脑配置(CPU、内存)下,AI的表现可能相差6个百分点。环境不够稳定,训练效果就不可控。

这意味着什么?

“造世界”不是简单的复制粘贴,而是一项高门槛、高成本的工程。你不能靠AI自己合成环境(质量太差),也不能全靠人工(太贵)。这需要一种新的能力:既懂AI需要什么,又懂如何构建稳定、复杂、真实的虚拟业务场景。

5. 下一个“Scale AI”是谁?一门新生意正在诞生

在大模型时代,Scale AI 靠给AI提供高质量的数据标注,估值冲到了290亿美元。

现在,数据标注的红利在减弱,“环境构建” 正在成为新的风口。

  • 创业公司入场:
  • UniPat AI: 阿里正在洽谈领投,估值25亿美元。他们专门做“任务设计+沙箱环境+评测标准”的一体化基建。
  • Deeptune: 被数据平台Mercor收购。Deeptune专门复刻Salesforce、Slack等真实软件环境,给AI当“健身房”。Mercor收购它,就是为了补齐自己在“环境构建”上的短板。
  • Scale AI自己: 也开辟了“强化学习环境”业务,新增项目中近一半涉及此领域。
  • 为什么大厂不外包?

虽然环境构建是个好生意,但腾讯、阿里、字节都在自建。因为环境直接决定模型的上限,这是核心机密,不能全外包。而且,运行这些环境需要大量的云计算资源(沙箱、隔离、高并发),大厂自己有云,成本更低,控制力更强。

  • 未来的机会在哪里?

大厂懂模型,云平台懂机器,但谁懂真实的业务流?

比如,一家医院的挂号系统怎么运作?一个律所的合同审核流程是怎样的?这些错综复杂的真实业务逻辑,是大厂和云厂商都不完全懂的。

因此,“懂行业+懂AI环境构建” 的公司,可能会成为下一个巨头。它们不需要自己训练大模型,但可以为大模型提供“真实世界的模拟器”。

💡 结语:从“解题”到“定义问题”

姚顺雨去年说,AI下半场的重心是“从解决问题转向定义问题”。

这句话现在有了具体的落点:通过构建复杂的环境,让AI学会在不确定性中定义问题、拆解问题、解决问题。

对于普通人来说,这意味着未来的AI助手将不再只是你的“聊天搭子”,而是你的“数字员工”。它能帮你处理复杂的行政事务、编写并调试代码、甚至管理你的日程和财务。

而对于投资者和创业者来说,“AI训练环境” 是一个正在爆发的基础设施赛道。它不像大模型那样烧钱无底洞,但它更贴近产业落地,更考验对真实世界的理解。

一句话总结: 以前我们给AI喂书,现在我们要给AI造世界。谁造的世界更真实、更复杂、更稳定,谁的AI就能在真实世界里更好地干活。