虎嗅

最安全的AI公司,也守不住安全承诺

当“最安全”的AI公司开始“裸奔”:一场关于信任、金钱与生存的博弈

大家好,我是你们的财经记者。今天我们要聊的,不是一篇枯燥的技术报告,而是一场发生在硅谷顶层的“信任危机”。

故事的主角是 Anthropic,这家被公认为 AI 行业里“最讲规矩、最注重安全”的公司。故事的核心人物是 Jacob Coxon,一位刚入职 4 个月的研究员。他在 2026 年 9 月 8 日突然辞职,并公开表示:两家公司(Anthropic 和 OpenAI)都在拿人类的生命冒险,为了追求超级智能,它们正在放弃安全底线。

这件事之所以炸裂,不是因为有人辞职,而是因为 Coxon 说了一句大实话:“我在股权归属前就走了,我不再需要靠推高 Anthropic 的估值来获利了。”

想象一下,你手里有一张即将兑现的巨额彩票(Anthropic 预计 10 月 IPO,估值 2 万亿美元),但你选择把它撕了。为什么?因为你觉得这家公司正在做一件错事,而且错得离谱。

今天,我们就用大白话,把这件事背后的逻辑拆解开,看看这到底是怎么回事。

---

一、 从“刹车片”到“装饰条”:安全承诺的悄悄改写

首先,我们要搞清楚 Anthropic 到底改了什么?

在 2023 年,Anthropic 发布了一份《负责任扩展政策》(RSP)。里面有一条非常硬核的承诺,我们可以把它理解为汽车的“紧急刹车系统”:

> “如果我们的安全措施没到位,我们就必须暂停训练更强大的模型。”

这是一个“做不到,就不许继续”的硬性约束。那时候,这是 Anthropic 的招牌,也是它区别于 OpenAI(追求速度)的核心卖点。

但是,到了 2026 年 2 月,Anthropic 发布了 RSP 3.0。这次更新,那个“紧急刹车”没了。取而代之的是一套更复杂的“仪表盘”:路线图、风险报告、外部监督。

通俗点说:

以前是:“如果刹车失灵,我就停车。”

现在是:“如果刹车有点问题,我会写报告解释为什么我还敢开,并且我会看着仪表盘开车。”

Anthropic 解释说,因为 AI 的能力边界太模糊,没法精确定义什么时候该停,所以刚性刹车不可操作。这话听起来有道理,但问题在于:既然边界模糊,为什么两年前要把这条承诺作为招牌?为什么偏偏在 IPO 前夕修改?

更让人警惕的是,就在同一时期,Anthropic 签下了未来十年高达 5170 亿美元的算力合同。一家把未来十年的“油费”都提前锁死的公司,很难主动踩刹车。安全承诺从“我们不做什么”(硬约束),变成了“我们怎么解释我们做了什么”(软解释)。

二、 消失的两个词:OpenAI 也在“卸妆”

你以为只有 Anthropic 在改文件?不,OpenAI 也在动。

OpenAI 在 2025 年 11 月发布的年度税务表格(990 表)中,悄悄修改了自己的使命陈述。

  • 以前: “构建安全地(safely)造福全人类的通用人工智能,不受财务回报需求的约束。”
  • 现在: “确保通用人工智能造福全人类。”

注意,两个词没了:

1. “Safely”(安全地):关于安全的承诺淡化了。

2. “不受财务回报需求约束”:关于钱的承诺没了。

这意味着,OpenAI 不再强调自己是为了人类安全而存在,也不再强调自己独立于资本利益。它变得更像一个纯粹的、追求利润最大化的科技巨头。

与此同时,OpenAI 在两年内解散了三个核心安全团队,包括著名的“超级对齐团队”。连 Ilya Sutskever 这样的大牛都离开去创立专门做安全的公司了。

解读:

这两家最强调安全的公司,在同一个时间段,都在重新定义“安全”的边界。这说明这不是某一家公司的道德滑坡,而是整个行业在资本和竞争压力下的集体“卸妆”。当“安全”不再是一个不可协商的前提,而变成一个可以谈判的变量时,危险就开始了。

三、 一个无解的悖论:为了更安全,必须更快?

Coxon 在采访中说了两句非常扎心的话,揭示了 AI 行业的死结:

1. “如果你面临竞赛压力,你就必须抄近路,或者跳过监督流程中的步骤。”

2. “对 OpenAI 和中国的过度偏执,有时会被用来为加速推进提供理由。”

这形成了一个可怕的“安全悖论”:

  • 逻辑 A: 如果 Anthropic 慢下来做安全评估,OpenAI 或中国对手就会抢先把超级智能做出来。
  • 逻辑 B: 如果对手先做出来,而对手的安全措施不如 Anthropic,那么全球的安全风险就会失控。
  • 结论: 为了“更安全”(防止不安全的人先做出超级智能),Anthropic 必须“更快”地实现超级智能。
  • 后果: 但“更快”意味着缩短训练、评估和发布的时间,研究人员用来理解模型内部机制、检查危险行为的时间必然减少。

大白话总结:

“为了更安全,我必须跑得更快。但我跑得越快,就越不安全。”

Coxon 辞职,不是因为他讨厌 Anthropic,而是因为他发现,在这个竞争格局下,没有任何一家公司能单方面保持安全。 这是一个系统性的死局。你换一家公司也没用,因为整个赛道都在加速,没有人敢踩刹车,因为踩刹车的人会被淘汰,或者被对手超越。

四、 三天下线:安全靠的是“事后救火”,不是“事前预防”

文章提到了一个关键事件:2026 年 6 月的“Fable 5”事件。

Anthropic 发布了新模型 Fable 5。两天后,亚马逊 CEO 打电话给白宫,说这个模型有漏洞,可以被“越狱”(绕过安全限制)。白宫紧急开会,商务部下达出口管制令,Fable 5 全球下线。

从发布到下线,只用了三天。

这里有一个残酷的事实:

让模型停下来的,不是 Anthropic 内部那条被改写的“安全红线”,而是风险已经释放之后,政府的强制介入。

这说明什么?说明 Anthropic 的安全承诺,在关键时刻并没有起到“事前拦截”的作用。它更像是一个“事后公关”或“事后合规”的工具。当风险足够大时,外部力量(政府)会在三天内反应。但问题是,风险已经释放了。

RSP 3.0 改写的那条红线,本来是要在风险释放之前起作用的。现在,它失效了。我们看到的不是“预防”,而是“事故处理”。

五、 投资人的噩梦:安全承诺值多少钱?

最后,我们把目光转向资本市场。

Anthropic 的估值高达 2 万亿美元,它的品牌故事是:“我是最安全的 AI 公司。” 投资人买的不只是模型能力,更是这套“安全治理”的承诺。

但是,如果安全承诺可以被竞争压力修改,那它在投资判断中就应该打折。

  • Morningstar 报告指出: Fable 5 事件让安全承诺变成了财务风险。
  • David Sacks(美国科技顾问)发声: 在调查清楚之前,Anthropic 的 IPO 应该暂停。

这对普通人意味着什么?

1. 品牌溢价崩塌: 如果“安全”只是营销话术,而不是真实约束,那么 Anthropic 的估值基础就不牢固。

2. 合规危机: 如果监管机构认定其“安全承诺与实际行动不一致”,这不仅是公关危机,更是法律合规危机。

3. 信任投票: Coxon 放弃股权,相当于给这个问题投了一张“不信任票”。他用自己的真金白银告诉市场:我不相信这个系统能自我纠错。

总结:

Coxon 放弃的股权,在 2 万亿美元的估值面前,确实是一粒尘埃。但他说的话,是一根针。

这根针刺破了 AI 行业最华丽的气球:我们以为我们在建造更安全的未来,但实际上,我们只是在建造更昂贵的、更不可控的、且必须靠政府最后兜底的机器。

当“安全”从“我们不做什么”变成“我们怎么解释我们做了什么”时,我们失去的,不仅仅是技术上的刹车,更是道德上的底线。

对于普通人来说,这意味着:

  • 不要盲目相信科技巨头的“安全承诺”,要看它们的行动和监管的反应。
  • 关注 AI 行业的监管动态,因为现在的安全,很大程度上依赖于政府的事后干预,而不是公司的事前自律。
  • 警惕“速度至上”的文化,在 AI 领域,速度往往是以牺牲安全为代价的,而这个代价,最终可能由全人类来买单。

这场博弈没有赢家。Anthropic 失去了灵魂研究员,OpenAI 失去了道德高地,而投资者,正站在悬崖边上,看着那辆没有刹车的赛车,呼啸而过。