虎嗅

对抗性完整:AI时代,别让一个局部正确骗过整个系统

该文章尚未提供 Français 解读,以下为中文版内容。

核心内容总结

这篇文章用生活中的“锁车后拉车门”“转账前再核对”等常见行为,引出一个叫“对抗性完整(Adversarial Completeness)”的安全理念:重要事情不能只靠一次确认或单一角度检查,要从不同维度验证,防止因信息变化、人为误导或系统漏洞,让看似流程完整的操作最终出问题。尤其在AI能自动执行复杂任务的时代,这种理念变得更关键——因为AI可能把错误解释得很合理,让人过早放心,最终导致不可逆的损失。

一、为什么“已经确认过”还会出事故?

很多事故不是因为没检查,而是检查一次后就默认“不会变”。比如:

  • 按了锁车键,但信号干扰导致车门没锁(检查了“按键动作”,没确认“实际锁上状态”);
  • 合同经过多人审核,但发出的附件被偷偷替换(流程完整,但中间内容变了);
  • 审批通过的转账,收款账号被骗子篡改(审批看的是“申请单”,执行时没核对“实际账号”)。

本质是“信任惯性”:前面的环节没问题,就默认后面也没问题,但现实中信息、状态随时可能变——第一次确认的是“动作做了”,第二次确认的是“结果对了”,这是两个不同的问题

二、对抗性完整到底是什么?

用大白话讲,它是一种“多角度防坑”的思维:

  • 对抗性(Adversarial):不是怕“偶然出错”,而是怕“有人故意搞事情”(比如骗子改账号、诱导审批人看错内容);
  • 完整性(Completeness):不是只检查一个环节(比如“有没有权限”),而是要覆盖所有可能的风险点(比如“权限合法,但这次操作是否超出范围?审批内容和执行内容是否一致?”)。

举个例子:转账时,不能只看“审批通过”,还要核对“收款人姓名和账号是否和申请一致”“金额有没有超限额”“当前环境是否安全(比如是不是在陌生设备上操作)”——这些都是不同角度的检查,缺一个就可能被钻空子。

三、AI时代,对抗性完整为啥更重要?

AI让“从想法到执行”的链条变长了:你说一句“转钱给客户”,AI要理解意图、拆计划、调用工具、申请权限、执行转账。中间任何一步出错(比如AI看错客户信息、被恶意文档诱导),都会直接造成损失。而且AI有个“迷惑性”:它能把错误解释得头头是道,让你觉得“没问题”——比如AI生成的转账计划看起来合理,但实际调用工具时选错了收款人。

传统信任机制在AI面前会失效:以前人是最终执行者,能手动核对;现在AI自动执行,你可能只看到“审批通过”的摘要,没注意到执行细节里的坑。所以必须用对抗性完整来“刹车”——比如让独立系统再核对一次执行内容,或者在关键步骤强制人工确认。

四、对抗性完整不是“增加更多审批”

很多人以为“多找几个人签字”就是安全,但其实:

  • 10个人看同一个被篡改的摘要,还是会一起错;
  • 连续弹5次“是否确认”,用户会机械点击,没用。

真正的对抗性完整是增加“独立角度”

  • 审批人看“业务意图”,执行系统看“实际对象”(比如审批的是“给A客户转1万”,执行时要核对“是不是A客户的真实账号”);
  • AI生成计划,独立规则检查“金额是否超上限”“操作是否合规”;
  • 流程走完,最终执行前再确认“当前状态和审批时一样吗?”

简单说:检查次数不重要,有没有新的信息和角度才重要

五、如何把对抗性完整变成制度?

不是靠个人“神经质”的谨慎,而是把这些习惯写进系统或流程:

1. 关键节点强制核对:比如转账前必须让用户手动输入收款人姓名最后一个字(防止系统自动填充错误);

2. 独立验证机制:用不同系统核对同一信息(比如财务系统和银行系统交叉验证账号);

3. 最终否决权:如果发现执行内容和审批不一致、金额超限额等,系统直接拒绝执行,不管前面流程多完整;

4. 区分风险等级:低风险操作(比如发普通邮件)可以快速过,高风险操作(比如删生产数据、转大额资金)必须多维度检查。

这样,“锁车后拉车门”就从个人习惯变成了组织的安全制度——不用每个人都时刻警惕,系统会在关键处帮你“再看一眼”。

结语

对抗性完整的核心不是“证明没问题”,而是“确保没漏掉可能出问题的角度”。在AI能直接执行现实操作的时代,它不再是“高级理念”,而是必须的“安全底线”——毕竟,最危险的不是机器犯错,而是所有流程看起来都对,却把一件错的事不可逆地执行到底。