虎嗅

从可信的主体到可信的结构:AI 治理的下一个战场

你好!我是你的财经记者兼经济学者朋友。今天我们要聊的这篇来自 Havenlon Labs 的文章,其实揭示了一个非常深刻、甚至有点“反直觉”的行业转折点。

以前大家问 AI:“你有多聪明?”

现在大家问 AI:“你能不能别乱动?谁有权让你停下来?”

这不仅仅是技术讨论,更是商业逻辑和信任机制的重构。下面我用大白话,把这篇长文拆解成五个核心方面,带你看懂 2026 年 AI 行业的底层逻辑变化。

1. 风向变了:从“比谁强”到“管得住”

核心观点: 过去几年,企业买 AI 就像买跑车,只看马力(能力上限);现在,企业开始关心刹车灵不灵、方向盘能不能被劫持(能力边界)。

详细解读:

回想一下前两年,企业评估 AI 时,眼睛都盯着“准确率”和“复杂任务处理能力”。那时候的逻辑很简单:AI 越强,我就能省越多的人力,赚更多的钱。大家默认的前提是:AI 的价值 = 它的能力上限。

但到了 2026 年,风向彻底变了。文章提到微软发布《Humanist AI Code of Conduct》草案,以及 Palantir、Nvidia 等巨头收紧对前沿模型的使用,这两件事看似无关,实则指向同一个痛点:企业不再担心 AI 不够聪明,而是担心它太聪明,聪明到能进入敏感区域,且难以控制。

现在的提问方式变成了:

  • 它到底能做什么?(边界在哪里?)
  • 如果它拿到了权限,它是否还应该执行?(权限与能力的分离)
  • 如果供应商本身不可信,这套系统还能用吗?(信任主体的转移)

这就好比以前我们请一个厨师,只关心他菜做得好不好吃;现在我们要请一个能自己买菜、自己做饭、自己洗碗、甚至能自己决定开火关火的“全能管家”。这时候,我们关心的不再是他的厨艺,而是:他会不会在我不注意的时候,把房子点了?我能不能随时让他停下?

2. 概念拆解:“聪明”和“有权”是两码事

核心观点: 过去我们混淆了 Intelligence(智力/能力)和 Authority(权限/授权)。AI 能做的事,不代表它应该被允许做。

详细解读:

这是文章里最硬核的一个逻辑拆解。在传统的软件时代(SaaS),代码是写死的。数据库执行删除指令,它只会删除,不会顺手把另一张表也清了。因为它的行为空间是有限的、确定的,所以我们信任供应商,因为软件本身没有“自主意识”。

但 Agent(智能体)不一样。Agent 能理解意图、拆解目标、调用工具、连续运行。它像一个真正的“行动主体”。

  • 能力(Intelligence): 来自训练。比如,一个 AI Agent 完全具备删除数据库的技术能力,因为它懂 SQL,它有权限。
  • 权限(Authority): 来自授权。比如,虽然它懂 SQL,但在当前这个时刻,它是否被授权删除这个特定的数据库?

矛盾点在于: 企业希望 AI 更自主(少点人工确认,提高效率),但又希望 AI 永远在人类控制之下。

如果每一步都要人点一下“确认”,那 AI 只是个高级助手,没省下多少事。如果不让人点,AI 就可能失控。

所以,行业被迫把这两件事拆开:“会不会做”是技术问题,“有没有权做”是治理问题。 一个 Agent 可能持有支付接口的凭证,但这不意味着它构造的每一笔付款都该被执行。能力是被训练出来的,但权限必须是被明确授予的,而且是有范围、有时效的。

3. 信任迁移:从“信人”到“信结构”

核心观点: 企业不再试图找到一个“绝对可信”的 AI 供应商,而是设计一套“即使供应商出错或恶意,系统也能兜底”的结构。

详细解读:

以前我们信任 AI,是因为信任那家公司(比如信任 OpenAI 或 Anthropic 不会滥用数据)。这叫“主体信任”。

但现在,AI 接触的数据太敏感了:源代码、安全策略、客户隐私、决策逻辑……甚至包括操作凭证。AI 供应商已经不仅仅是工具商,而是企业的“认知基础设施提供者”。

这时候,企业发现:我不能无限扩大对单一主体的信任。

于是,我们看到 Palantir 要求 Anthropic 提供“零数据保留”保证,Nvidia 限制模型使用范围。这些动作背后的逻辑不是“云不安全”,而是“削减对单一主体的依赖”。

这就像航空业或核工业。飞机安全不靠“飞行员绝对不犯错”,而是靠多重冗余系统:如果飞行员失误,自动驾驶接管;如果传感器坏了,备用传感器顶上。

AI 行业正在经历同样的进化:Trust the Actor(信任执行者) -> Trust the Structure(信任结构)。

未来的架构不会问“哪个模型永远值得信任”,而是问:

  • 无论用哪个模型,它最多能走到哪一步?
  • 哪些边界它自己改不了?
  • 如果模型被黑了,系统还有没有最后一道防线说“不”?

这是一种更成熟、更工程化的信任观:不假设任何主体是完美的,而是假设任何主体都可能失败,然后设计系统来容纳这种失败。

4. 治理下沉:从“管嘴”到“管手”

核心观点: AI 正在从“信息系统”变成“执行系统”。治理的重点从“它说了什么”变成了“它做了什么”,因为执行动作往往不可逆。

详细解读:

以前的 AI 治理,大多停留在“模型之前”:什么数据不能进,什么 Prompt 不能说,什么内容不能生成。这假设 AI 的输出只是“信息”,错了可以重来,大不了重新生成一遍。

但现在,Agent 开始发邮件、改代码、调 API、转资金、控设备。它进入了Execution System(执行系统)。

  • 信息层的错误: 代价是“重来一次”。
  • 执行层的错误: 代价是“善后”。钱转出去了收不回来,服务器删了数据没了,代码部署了线上崩了。

所以,治理的重心必须下沉。不能只盯着模型有没有“想”做坏事,而要盯着它在 Runtime(运行时)、Authority(授权路径)和 Execution Path(执行路径)上的每一个具体动作。

“Human Control”(人类控制)不能只是一句口号,必须变成可检验的工程行为:

  • 模型不得抵抗关闭。
  • 模型不得隐藏行为轨迹。
  • 持续运行的任务必须有明确的停止条件。

如果“人类控制”不能映射成代码层面的硬性约束,它就只是一句伦理宣言,毫无实际保护力。

5. 终极洞察:限制 AI,才是敢用 AI 的前提

核心观点: 让 AI“听话”不够,因为听话的 AI 执行错误指令会更高效。真正的安全,是建立一道“即使判断错误,也能说 No”的边界。

详细解读:

这是文章最反直觉、也最深刻的结论。

整个行业都在努力让 AI 更 Alignment(对齐)、更服从、更少幻觉。这当然重要。但作者指出:仅仅让 AI“更听话”,解决不了根本问题。

为什么?因为听话本身不解决判断错误的问题。

  • 如果一条指令写错了,一个绝对服从的 AI 会高效地把错误执行到底。
  • 如果管理员误操作,一个绝对服从的 AI 会立刻执行,没有缓冲。
  • 如果模型被 Prompt 注入攻击,一个绝对服从的 AI 可能会把恶意代码当成正常指令执行。

如果我们假设某一个角色(无论是人、模型还是策略)永远正确,那个角色就会成为系统的单点故障。

所以,成熟的 AI 基础设施必须接受一个不舒服的前提:没有任何主体应该天然拥有最终权威。

我们需要构建的,不是一个“更听话的 AI”,而是一个“即使 AI 不听话、即使人犯错、即使策略有漏洞,系统依然能在那一刻说 No”的机制。

总结来说:

过去,我们问:“AI 值得信任吗?”

未来,我们要问:“即使 AI 不值得被完全信任,我们是否仍然能够安全地使用它?”

这听起来像是在限制 AI,实际上,只有当 AI 在需要的时候“无法行动”(即被有效约束),我们才真正敢把更多重要的事情交给它。 这才是 AI 大规模落地、真正产生商业价值的基石。

---

给普通人的启示:

如果你在企业里负责引入 AI,别再只盯着“这个模型多强”。去问问 IT 和安全团队:

1. 这个 AI 能碰到哪些核心数据?

2. 如果它想删库,谁能拦得住它?

3. 它的每一步操作,有没有独立的日志和回滚机制?

4. 我们是不是太依赖这一家供应商了?有没有备份方案?

从“相信 AI”到“限制 AI”,这才是 2026 年 AI 时代的生存法则。