虎嗅

AI 真正的问题,也许不是能力增长太快,而是控制能力增长得太慢

你好!我是你的财经分析助手。这篇来自 Havenlon Labs 的文章,虽然读起来有点“硬核”,但它其实戳中了一个正在发生、却容易被大众忽略的核心痛点:AI 正在从“只会说话”变成“真的会干活”,而我们的“刹车系统”还没造好。

下面我先用大白话给你划重点,然后拆解成五个方面,带你彻底看懂这场关于“AI 控制权”的深层博弈。

📝 核心内容总结

一句话概括:

Anthropic CEO Dario Amodei 呼吁全行业“踩刹车”,因为 AI 从“生成文字”进化到了“执行动作”(Agent 阶段),它现在能直接操作电脑、转账、改代码。但问题是,AI 能力的增长速度远远快于我们建立安全控制机制的速度。

核心观点:

以前我们担心 AI 会不会“变坏”或“撒谎”,现在我们要担心的是 AI 会不会“乱动”。因为 AI 现在有了手(工具调用权限),如果给它太大的权限(Authority),一旦它判断出错或被黑客利用,后果就是现实世界的灾难。所以,未来的重点不是让 AI 永远听话,而是把“能力”和“权力”拆开——你可以很聪明,但你不能随意改变现实,必须有人或制度在关键时刻能按下“停止键”。

---

🔍 深度拆解:五个维度的通俗解读

1. 剪刀差效应:为什么“刹车”造得比“油门”慢?

大白话解释:

这就好比汽车技术。发动机(AI 模型能力)每半年就能升级一次,马力翻倍;但刹车系统、安全带、交通规则(安全控制机制)却需要几年才能完善。

详细解读:

  • 能力增长是“快变量”: 只要有钱买显卡、有算法优化,AI 变聪明、变能干的速度是以“月”甚至“周”计算的。
  • 控制增长是“慢变量”: 建立一套安全体系,需要制定标准、测试漏洞、修改法律、调整公司流程、甚至等待硬件更新。这是一个以“年”为单位的过程。
  • 结果: 我们手里拿着一个越来越强大的“超级员工”(AI Agent),但给它配的“监控摄像头”和“门禁卡”还是上个时代的水平。这种能力速度 > 控制速度的剪刀差,就是最大的风险来源。

2. 权限陷阱:聪明不等于有权,别把“钥匙”随便给

大白话解释:

以前我们觉得,一个人越专业、越靠谱,就可以给他越大的权限(比如让实习生查数据,让经理批预算)。但现在,AI 的能力可能在一次更新后突然暴涨,但它手里的“钥匙”(API 密钥、账号权限)还是按它“昨天”的能力配的。

详细解读:

  • 静态权限 vs 动态能力: 很多公司给 AI 配置权限时,是基于它“能做什么”的静态假设。比如,给一个写代码的 AI 配了数据库读取权限。
  • 风险爆发点: 如果这个 AI 升级后,不仅能写代码,还能自己规划步骤、绕过限制、甚至攻击其他系统,但它手里依然握着那把“数据库钥匙”。这时候,能力变了,权限没变,危险就来了。
  • 核心原则: 文章提出一个反直觉但重要的原则:Capability ↑ ≠ Authority ↑(能力增强不等于权力增强)。你不能因为 AI 变聪明了,就自动赋予它更大的现实操作权。信任是基于过去的表现,但权限是面向未来的支票,这两者不能画等号。

3. 从“看模型”到“看执行”:安全重心的转移

大白话解释:

以前我们盯着 AI 的“脑子”(模型本身),问它:“你诚实吗?你会不会骗人?”现在我们要盯着 AI 的“手脚”(执行环境),问它:“你刚才那个动作,被允许做吗?有没有人批准?”

详细解读:

  • 旧思路的局限: 试图让模型“永远正确”或“永远诚实”几乎是不可能的,因为模型太复杂,总会有 Bug 或被诱导。
  • 新思路的优势: 承认 AI 会犯错,但通过结构设计来限制错误的影响。
  • 例子: 银行不会因为交易员很聪明,就让他不用经过风控系统直接转账。操作系统也不会因为某个软件算法好,就给它最高权限。
  • 关键机制: 必须在“判断”和“执行”之间加一道闸。AI 可以提出“我要转账 100 万”的建议(Capability),但是否真的转出去,必须由独立的、AI 无法篡改的系统或人来决定(Authority)。
  • Kill Switch(紧急停止键): 就像飞机有自动驾驶,但飞行员必须能随时接管。AI 系统必须有一个独立的“停止键”,当 AI 行为异常时,能强制中断其行动,而不是依赖 AI 自己“意识到错误并停止”。

4. 第三方监督的困境:谁来监督“监工”?

大白话解释:

Amodei 建议让独立的第三方进来检查 AI 安全。这就像请外部审计师查账。但问题是,审计师也是人,也会看漏,也可能被收买,或者标准不统一。

详细解读:

  • 自我声明的不可靠性: 公司自己说“我很安全”是没有说服力的,就像司机说自己开车很稳一样。
  • 第三方评估的挑战:
  • 谁选评估者? 如果由被评估的公司选,可能存在利益冲突。
  • 标准是什么? 什么是“足够安全”?没有统一标尺。
  • 责任归属: 如果评估者没发现问题,出了事谁负责?
  • 深层矛盾: 真诚不能替代制度。好人也会犯错,优秀的工程师也会低估风险。因此,不能只靠“找好人来监督”,而要靠制度化的、可验证的、不可绕过的技术边界。第三方评估是必要的一步,但绝不是终点。

5. 未来的稀缺资源:不是更聪明的 AI,而是更成熟的“约束基础设施”

大白话解释:

过去两年,大家都在卷“谁家的 AI 更聪明、更快、更强”。未来,真正值钱的、稀缺的,可能是“谁家的 AI 更安全、更可控、更合规”。

详细解读:

  • 市场风向转变:
  • 过去: 资本涌入 GPU、大模型、推理加速,目标是扩大能力边界。
  • 未来: 资本将涌入身份认证、权限管理、行为审计、隔离沙箱、合规接口,目标是划定能力边界。
  • 控制不是限制,是前提:
  • 就像飞机推力越大,飞控系统越复杂,但飞机才能飞得更高更远。
  • AI 的“控制层”(Control Layer)将成为新的基础设施。它包括:短生命周期的密钥、独立于 AI 之外的证据记录、细粒度的操作权限、物理层面的隔离等。
  • 终局思考:
  • 我们不需要一个“永远听话”的 AI,我们需要一个即使 AI 犯错、被黑客攻击、或者出现 Bug,也无法轻易造成不可逆灾难的系统。
  • 最终,我们要治理的不是 AI 这个“聪明人”,而是不受约束的权力。让机器越来越聪明,但不把越来越多的现实权力无限制地交给它,这才是 AI 时代成熟的标志。

---

💡 给普通人的启示

1. 对于企业/开发者: 如果你正在部署 AI Agent,不要只关注模型有多强,更要关注权限管理。给 AI 的权限要“最小化”、“短时效”,并且要有独立的监控和紧急停止机制。不要假设 AI 会一直“守规矩”。

2. 对于投资者: 关注那些提供 AI 安全、合规、身份验证、行为审计服务的公司。这可能是下一个“卖铲子”的赛道。

3. 对于普通人: 当 AI 开始帮你自动操作(如自动购物、自动转账、自动发邮件)时,保持警惕。理解“能力”和“权力”的区别,确保你始终拥有最终的“否决权”。

总结来说,这篇文章不是在吓唬大家说 AI 要毁灭世界,而是在提醒我们:技术跑得太快,我们的“护栏”还没修好。现在,修护栏比造更快的车更重要。