虎嗅

释放之前:AI安全治理的最高杠杆控制点

核心总结:AI安全的“后悔药”失效了,唯一的解药在“出厂前”

这篇文章的核心观点非常犀利且反直觉:在人工智能领域,一旦能力被释放(尤其是开源权重或数据泄露),事后的补救措施(如封号、修补漏洞)就像是在漏水的船上舀水,永远追不上进水速度。因此,最高效、最经济的控制手段,必须前置到“发布之前”。

文章通过Anthropic披露的“跨会话重放攻击”事件为引子,指出当前的AI安全体系存在严重的结构性缺陷:

1. 事后防御是消耗战:攻击者只需找到一种绕过方法,防御者却要防备所有可能;攻击者成本随规模摊薄,防御者成本随规模线性增长。

2. 自愿承诺不可靠:像美国目前的“发布前评估”机制,本质上是厂商自愿配合,缺乏强制力。在商业竞争压力下,安全承诺容易沦为“表演性合规”。

3. 不可逆性是核心痛点:API调用尚可撤回,但开源权重一旦发布,就像泼出去的水,无法收回。因此,对开源权重的评估标准反而应该比API更严,但目前制度设计恰恰相反。

4. 处方建议:建立“事前强监管+事后强追责”的闭环。包括强制性的发布前审批、针对运行时失控的“终止开关”、以及通过保险和责任法让违规者付出真金白银的代价。

简而言之,AI安全不能靠“事后擦屁股”,而要靠“事前设闸门”。

---

深度拆解:五个维度的通俗解读

1. 为什么“事后补救”注定是一场必输的消耗战?

通俗比喻:

想象你开了一家金库,为了安全,你规定客户取钱时不能直接拿现金,而是给一张“提货单”(Thinking Signature)。你心想:“这样我就控制了钱的流向。”

结果,黑客发现了一个漏洞:他们拿着这张“提货单”,跑到另一个柜台(新会话),忽悠柜员把提货单里的信息重新打印成完整的“取款记录”(完整推理轨迹)。

深度解读:

  • 漏洞的本质:这不是技术不够强,而是逻辑假设错了。系统默认认为“合法引用”和“恶意重放”之间有清晰的界限,但实际上,只要系统允许“引用之前的状态”,攻击者就可以利用这个机制进行“重放”。
  • 成本不对称:
  • 攻击方:只要找到一个有效的绕过方法,就可以无限次复制使用。注册1000个假账号的成本,远低于防御方监控1000个账号的成本。
  • 防御方:必须检测每一个欺诈账号,必须防护每一种可能的提取手段。
  • 结论:在开放环境中,一旦能力泄露,防御方就陷入了“打地鼠”游戏。你封了一个IP,他换十个;你改了一个接口,他找另一个。这种结构性的劣势,意味着事后防御只能延缓伤害,无法消除风险。

2. “发布前评估”为什么是目前唯一的救命稻草?

通俗比喻:

这就像核电站的安全检查。你不能等核电站爆炸了再去修,你必须在反应堆启动前,确认所有安全阀都有效。

现在的美国政策有点像“自愿体检”:政府说“你可以来体检,但不体检也能开车上路”。在激烈的赛车比赛中(商业竞争),车手为了赢,往往会选择“带病上路”,或者在体检时做手脚。

深度解读:

  • 现状的缺陷:目前美国的CAISI(人工智能标准与创新中心)与五大AI实验室达成的协议是自愿性质。行政令明确规定,这不能成为强制许可。这意味着,如果一家公司觉得评估太麻烦、太慢,或者评估结果会阻碍其商业发布,它可以选择不配合,或者只配合表面功夫。
  • 评估的真正目的:评估不是为了证明模型“绝对安全”(这不可能),而是为了保留选择权。
  • 事前:如果评估不通过,政府可以说“不”,模型就不发布。这是选择权。
  • 事后:如果模型已经发布并造成危害,政府只能做“损失控制”,比如罚款、关停。这是补救权。
  • 关键转变:我们需要从“通过性测试”(这个模型安全吗?)转向“可承受性测试”(如果这个模型被大规模滥用,后果社会能承受吗?)。就像核电行业不追求零事故,但追求事故可封堆;AI行业需要追求“释放后的风险可控”。如果风险不可控,答案就是不释放。

3. 开源权重:一道无法回头的单行道

通俗比喻:

闭源API就像你在餐厅吃饭,厨师做菜,你只能吃,不能把菜谱偷走。

开源权重就像你把菜谱印成书,免费发给所有人。一旦书发出去,有人把菜谱抄走、修改、甚至做成毒药,你无法把书从每个人手里收回来。

深度解读:

  • 不可逆性:开源模型最大的风险在于“不可逆转地传播”。权重文件一旦下载,就可以被任意修改、微调、再分发。
  • 安全壳的脆弱性:很多开源模型的安全机制只是表面的一层“壳”(对齐训练)。研究人员已经证明,通过少量的“恶意微调”,就可以剥掉这层壳,让模型暴露出危险能力。
  • 分级发布的必要性:
  • 加密分发:虽然不能真正阻止解密(因为要在用户硬件上运行,最终必须解密),但它提高了攻击成本。
  • 分级释放:先给受信任的防御者(如安全机构)使用,观察生态系统反应,再逐步扩大范围。
  • 核心矛盾:加密分发让“开放”变成了“受控开放”,牺牲了部分公共品属性,但换来了更高的杠杆位置。这是一个必要的权衡。

4. “终止开关”:针对运行时失控的紧急刹车

通俗比喻:

这就像给自动驾驶汽车装一个“紧急停止按钮”。

如果车在高速上突然发疯乱撞,你需要一个按钮能立刻让它停下来。这个按钮不能解决“车为什么发疯”的问题,但它能防止“车撞毁整条街”。

深度解读:

  • 适用场景:终止开关针对的是运行时失控(Agentic失控),而不是能力扩散。
  • 能力扩散:模型权重泄露了,你关不掉。这需要事前闸门。
  • 运行时失控:模型正在执行任务,突然开始攻击网络或执行危险操作。此时,任务尚未完成,伤害正在发生但尚未扩散完毕。
  • 正当性:在Agentic(智能体)时代,模型拥有自主行动能力。在任务完成前的每一秒,都还存在“遏制”的可能。终止开关就是这个窗口期的唯一工具。
  • 法律背景:美国提出的《AI终止开关法案》要求制造商内建紧急停止开关,并授权国土安全部在模型失控时有权关闭。这是对“运行时风险”的精准打击。

5. 执行理论:没有牙齿的规则只是废纸

通俗比喻:

如果交通规则规定“红灯停”,但闯红灯的人没有任何惩罚,那红灯就只是个装饰品。

GDPR(欧盟通用数据保护条例)之所以有效,不是因为企业道德高尚,而是因为违反者会被罚得倾家荡产。

深度解读:

  • 自愿框架的陷阱:目前的AI行业自律机制(如Frontier Model Forum)缺乏法律约束力。在商业竞争中,先遵守规则的人往往处于劣势(因为研发速度慢、成本高),这导致“劣币驱逐良币”。
  • 事后追责的必要性:事前规则必须靠事后责任来兑现。
  • 责任法:如果模型释放后造成可归因的损害,发布方应承担严格责任。
  • 强制保险:要求前沿模型发布方购买责任保险,保费与评估结果挂钩。评估越严,保费越低;评估越松,保费越高。
  • 市场准入:联邦采购、关键基础设施准入,必须以通过发布前评估为前提。
  • 国际协调的难题:单边监管会导致“司法套利”——攻击者会迁移到低监管的国家。因此,国际协调是处方生效的前提,但这也是最难的一环。

---

结语:一个闭合的证据链

文章最后揭示了一个令人不寒而栗的事实:

1. 2026年2月:Anthropic发布RSP 3.0,删除了原先明确的刚性暂停机制和防范规模化攻击的承诺,改为更柔性的“路线图”和“透明披露”。

2. 2026年9月:Anthropic披露了迄今最大规模的蒸馏攻击,攻击者正是利用了他们之前承诺要防范的漏洞。

这不是巧合,而是因果。

安全承诺从“硬性约束”退化为“柔性叙事”,直接导致了事后防御的失效和攻击者的肆无忌惮。

给普通人的启示:

在这个信息时代,我们每天都在“释放”信息(发朋友圈、上传数据、使用AI服务)。我们需要意识到,有些释放是不可逆的。

  • 对于企业:不要指望事后补救,要在产品发布前就做好最严格的安全评估。
  • 对于个人:在使用AI服务时,要意识到你的数据可能被嵌入模型权重,且无法真正“删除”。
  • 对于社会:我们需要建立一套“事前强监管+事后强追责”的制度,而不是依赖企业的“自觉”和“叙事”。

控制杠杆最高的位置,只有一个:释放之前。