虎嗅

从防止入侵,到约束不可预测性:AI 正在改写安全的基本问题

该文章尚未提供 Русский 解读,以下为中文版内容。

核心内容总结

过去三十年,网络安全的核心是“防外部非法入侵”——通过防火墙、权限控制等手段,阻止没权限的人/程序干坏事。但AI Agent的出现彻底改变了游戏规则:它有合法身份、合法权限,却因为自身的“不确定性”(无法精确预测行为),可能在完全合规的情况下“好心办坏事”。未来安全的重心不再是“谁能做”,而是“做的事会不会造成不可挽回的后果”,需要建立独立于AI的“执行边界”,确保即使AI犯错,影响也能被控制。

一、过去的安全为啥能管用?因为系统“说一不二”

传统软件就像一台精密的机器:输入相同、状态相同,结果一定相同。比如你给它一个指令“只读数据库”,它就绝不会去修改数据;没有删除权限的账户,肯定删不了文件。这种“确定性”让安全规则很好制定——只要把“能做什么”划清楚,就能管住“会做什么”。

但AI Agent不一样。它不是按固定程序走,而是像个“灵活的助手”:你让它完成一个目标,它可能想出10种不同的方法,甚至组合工具的方式你都没见过。就算输入差不多,它的推理、计划也可能变。这就导致:权限只能证明它“有权做”,却没法保证它“做对了”。安全问题从“能不能干”变成了“该不该干”,这是本质的变化。

二、最可怕的不是黑客,是AI“合法地做错事”

现在大家讨论AI安全,还总在担心“模型被攻击”“数据泄露”——这些还是传统安全的思路,找“坏人”。但更棘手的是:没有坏人,AI也没被黑,它就是单纯“判断错了”。

比如一家公司让AI自动处理云服务器故障:AI有合法权限重启服务、删除资源。某天它发现某个服务异常,为了快速恢复,删了一个它认为“可以重新生成”的资源。结果这个资源是其他服务的依赖,删了之后整个系统崩溃了。所有传统安全检查都通过了(身份合法、权限匹配),但事故还是发生了。

传统安全只回答“你能不能做”,AI时代的安全必须回答“你现在应该做吗?”——这两个问题以前重合,现在彻底分开了。

三、AI从“嘴炮”变“动手”,风险直接落地

大模型刚出来时,最多就是输出错误文本,比如胡说八道(幻觉),但人会把关,不会直接造成现实损失。但AI Agent不一样:它能调用API、转钱、删数据库、控制设备——不确定性第一次有了“执行权”。

这就像一个人说“我要转账”和真的转了钱的区别:AI的判断是概率性的(比如90%置信度),但现实操作是“非黑即白”的——转账要么成功要么失败,数据要么删了要么没删。AI可以反悔,但现实没法“撤回”。所以安全重心必须从“优化AI正确率”转向“控制执行后果”——就算AI错了,也不能让它干出无法挽回的事。

四、安全要防的不再是“恶意”,而是“合理的错误”

传统安全盯着“坏人”:恶意代码、黑客、盗号。但AI的风险可能完全没有恶意——它认真理解任务、合理规划步骤、严格遵守权限,却因为“没理解上下文”“工具返回异常数据”“和其他AI配合出问题”等原因犯错。

更麻烦的是,聪明的AI犯错会显得“很合理”。比如它删数据前会给你一份“逻辑自洽的报告”,解释为什么要删,你可能都看不出问题。这时候不能让AI自己检查自己——就像不能让学生自己批试卷,得有独立的第三方判断。

五、未来安全:默认AI会犯错,然后限制后果

航空、核工业早就懂这个道理:不指望发动机永远不坏,而是设计“故障后不会爆炸”的系统。AI安全也一样——成熟的架构不会赌“AI永远正确”,而是默认它会犯错,然后问:“这个错误能酿成灾难吗?”

比如:AI能不能直接改生产环境?能不能一次性转走所有钱?有没有一道“最后关卡”(独立于AI的系统),在它执行危险操作前拦住?这种“执行边界”要满足两个条件:

1. 对抗性:判断的系统和AI不是一伙的(不同源),不会一起犯同一个错;

2. 完整性:边界覆盖所有执行路径,不能有漏洞(AI会找没被覆盖的路)。

简单说,未来安全不是“让AI不犯错”,而是“就算AI犯错,也不会搞砸一切”。

结语

过去我们花三十年防“坏人进系统”,未来可能要花同样时间防“好人(AI)干错事”。当AI能直接操作现实世界时,安全的核心不再是“谁可以做”,而是“什么事最终能变成现实”——这是AI从“工具”变成“基础设施”的必经之路。