虎嗅

从好人政治到好制度:AI Agent 也必须经历一次现代化

该文章尚未提供 Français 解读,以下为中文版内容。

核心内容总结

这篇文章把AI Agent的治理逻辑和人类社会制度的演变做了对比:我们现在对AI Agent的期待,还停留在“找完美主体”的古老思维里——希望它聪明、对齐(和人类想法一致)、不犯错;但现代制度的精髓,是承认主体永远不完美,通过设计规则限制错误的破坏力。文章认为,AI Agent的真正安全,不是靠训练出“永远正确的AI”,而是建立一套制度,让AI的错误无法转化为大规模现实灾难,就像人类社会靠合同、法律、审批等制度,让普通人也能安全协作一样。

详细拆解解读

1. 我们对AI Agent的期待,还在“找明君”的老路上

古代人治理国家,总希望遇到贤明的君主;现在我们对AI Agent的期待,其实和这差不多:希望它更聪明(少犯傻)、更对齐(懂我们的意思)、更少幻觉(不编假信息)、更能抵抗诱导(不被坏人骗)。本质上,都是在找一个“完美主体”——只要这个主体足够好,复杂问题就解决了。

但这种思路有个大问题:它没法规模化。古代部落几十人,靠首领的品德能维持秩序;但国家变大后,不可能保证每个官员都廉洁、每个君主都贤明。AI Agent也是一样:当它从“只会生成文字”变成“能操作资金、修改数据库、控制设备”时,光靠“AI本身完美”是不够的——因为AI永远会犯错(比如误解指令、信息不全、遇到没见过的情况)。

2. 现代制度的聪明之处:不赌“人完美”,只防“错扩散”

现代社会能运转,不是因为人变完美了,而是因为制度接受了“人会犯错”这个事实,并设计了限制错误的规则:

  • 公司的财务审批:不是不信员工,而是防止一个人误转钱或贪钱;
  • 航空的交叉检查:不是不信飞行员,而是防止一个人操作失误;
  • 银行的双人复核:不是不信柜员,而是避免单一错误造成损失。

这些制度的核心不是“消灭错误”,而是“让错误不毁掉整个系统”。比如,你转100万需要领导审批,就算你误操作,领导也能拦下来;飞行员操作错了,副驾驶能检查出来。这就是从“依赖好人”到“依赖好结构”的转变。

3. AI Agent的特殊风险:错误能像病毒一样快速放大

人类犯错有物理限制:你要睡觉、要走路、一次只能做一件事。但AI Agent没有这些限制:它可以在几秒内调用几十个工具、修改几百个文件、向成千上万人传播错误。比如,AI如果误解了“清理无用数据”的指令,可能瞬间删光整个数据库;而人做这件事,可能要花几小时,还会中途发现不对。

所以AI的真正危险,不是“会犯错”(人类也会),而是“错误能规模化执行”。如果我们还只盯着“让AI更完美”,就是把越来越大的权力交给一个永远不可能100%正确的主体——这和古代期待“永远贤明的君主”没区别。

4. 治理AI的关键:控制错误的“执行权”,而不是消灭错误

文章里有个重要的区分:AI“想错了”和AI“做错了”是两回事。比如:

  • AI错误认为“应该转100万给某人”,但如果它没有直接转账的权限,这只是个想法,不是灾难;
  • AI错误认为“应该删除服务器数据”,但如果需要人类确认才能执行,这也不会造成损失。

所以,AI安全的核心不是“让AI不犯错”,而是“不让错误的想法变成现实行动”。比如:给AI设置转账额度(超过1万必须人类确认)、高风险操作需要双人复核、敏感数据禁止AI直接访问。这些规则,就是把AI的错误锁在“想法层面”,不让它变成实际伤害。

5. 从“伦理口号”到“制度规则”:AI安全需要落地的约束

过去我们谈AI伦理,都是“要公平”“要保护隐私”“不要伤害人”这些抽象原则。但现在AI能行动了,这些原则必须变成具体的制度:

  • “不要伤害人”→“AI不能操作危险设备(比如工厂机械臂)除非人类在场”;
  • “保护隐私”→“AI不能把用户数据发送到外部服务器”;
  • “高风险操作要监督”→“AI部署代码前必须经过代码审查工具和人类工程师双重确认”。

伦理告诉我们“什么是对的”,但制度告诉我们“错了会怎样”。只有把抽象原则变成可执行的规则,AI才能真正安全地进入现实世界。

结语

AI Agent的治理,最终要走人类社会走过的路:从“找完美主体”到“建可靠结构”。我们不需要AI永远不犯错,只需要让它的错误在可控范围内。就像现代商业不是因为商人不贪婪才存在,而是因为合同、法律能处理违约;AI Agent的未来,也不是建立在“完美AI”之上,而是建立在能限制错误的制度之上。这才是AI Agent真正的“现代化”。