虎嗅

AI时代,那些藏在安全背后的数学理论

该文章尚未提供 Deutsch 解读,以下为中文版内容。

核心内容总结

这篇文章聚焦AI从“生成内容工具”到“现实执行系统”的质变——以前AI错了能改(比如文字写错重生成),现在错了可能造成不可逆损失(比如转错巨款、删生产数据)。传统用“正确率99%/99.9%”衡量AI的方式存在致命缺陷:它只看错误次数,忽略错误后果和极端风险。文章用7个数学视角拆解了AI执行安全的关键:错误不等价、历史无事故≠无风险、罕见事故代价更大、多人审批需独立判断、AI置信度≠现实安全、最后防线要简单保守、不仅降错还要限错。

详细拆解解读

1. 别被“高正确率”忽悠——错误的代价比次数重要

我们常觉得“99.99%正确率”就是安全,但这个数字只统计“错了多少次”,不管“错的是什么”。比如AI分错一封邮件和转错1亿元,在正确率里都是“1次错误”,但后果天差地别。

用数学公式说:风险=发生概率×可能损失。假设某错误概率是万分之一,但每次损失1亿元,风险就是1万(虽然概率低,但损失大到企业扛不住)。更关键的是:企业能承受每年稳定损失1万,却可能因一次1亿损失直接倒闭——数学上的“平均值抵消风险”对单次致命错误无效。

安全评估的核心不是“平均错多少次”,而是“最坏情况下损失有多大”。

2. “从没出事”≠安全——小概率风险藏在暗处

有人说“系统跑了一万次都没出事”,但这只能说明过去没触发风险,不能证明风险不存在。用公式算:一次都不出事的概率=(1-p)^n(p是单次风险概率,n是测试次数)。比如p=十万分之一,n=1万,结果≈90%——即使系统真有风险,跑一万次也有90%概率看不到问题。

很多重大事故前,系统都“稳定运行”很久,因为风险一直存在,只是没遇到触发场景。“没看到风险”≠“风险不存在”。

3. 越少见的错误越致命——极端场景才是命门

频繁的小错(比如页面卡顿)容易被解决,但真正危险的是几年一遇的大错——一次抵得上所有小错总和。比如:

  • 问题A:1%概率损失100元(平均风险1元)
  • 问题B:0.001%概率损失1000万(平均风险100元)

B虽然少见,但风险是A的100倍,且一旦发生就是实打实的1000万。

就像一条平均1米深的河,中间有个5米深的坑——平均深度没用,决定安全的是深坑。AI执行系统也是:普通任务小错影响体验,极端场景(跨境转账、紧急操作)的一次错误可能让企业倒闭。

安全评估要问:高金额、陌生地址、多规则冲突这些场景下,错误率是多少?

4. 多人审批不是万能药——独立判断才有效

企业用多人审批降风险,但前提是审批者的判断独立。比如三个独立审批者各10%错率,多数通过时,至少两人同错的概率仅2.8%(远低于单人)。但如果三个人都看同一份AI生成的摘要,没查原始数据,就是重复同一个错误——人数多了,信息没增加。

增加审批层同理:如果第二道防线只看和第一道一样的材料,风险几乎没降。真正有用的是“独立信息来源”(比如一个人看摘要,另一个人查原始命令)。

5. 最后防线要“笨”一点——简单规则才能拦大错

既然前面的方法都有漏洞,最后一道防线该怎么做?答案是:别太聪明,要简单保守。

AI负责处理复杂判断(理解文件、处理例外),但最后防线只需检查几个硬条件:金额是否超限?目标地址是否验证?授权人数够不够?设备状态正常吗?只要一项不满足,就拒绝执行。它不需要理解“紧急情况”,也不会被“充分理由”说服——这正是它的价值。

比如AI建议转钱到新地址,防线只需检查地址是否经过3天验证;AI说操作紧急,防线只需检查紧急状态下的金额限制。这样才能守住底线,不让错误变成不可逆的现实。

最后一句话总结

概率可以帮AI做判断,但不能让它独自拥有执行权——安全的核心是:假设错误迟早会发生,然后用简单规则拦住它。