虎嗅

信頼できる主体から信頼できる構造へ:AIガバナンスの次の戦場

原文:从可信的主体到可信的结构:AI 治理的下一个战场

こんにちは!私はあなたの財経ジャーナリストであり、経済学者の友人です。今日お話しするのはHavenlon Labsからの記事で、非常に深い洞察を含んでおり、少し「反直感的」な業界の転換点を明らかにしています。

以前は皆、AIに対して「あなたはどれだけ賢いのか?」と尋ねていました。

しかし今では、「あなたは無闇に動かないでくれるか?誰があなたを止める権限を持っているのか?」と尋ねています。

これは単なる技術的な議論ではなく、ビジネスロジックと信頼メカニズムの再構築でもあります。以下では、この長文を5つの核心的な側面に分けて、2026年のAI業界の根本的な変化を理解できるように説明します。

1. 方向性の変化:「誰が最も強いか」から「制御できるか」へ

核心的な見解: 近年、企業がAIを導入する際には、そのパワー(能力の上限)だけを重視していました。しかし今では、ブレーキが効くか、ハンドルが乗っ取られないか(能力の境界)にも注目し始めています。

詳細な解説:

2年前を振り返ると、企業はAIの評価において「精度」と「複雑なタスクの処理能力」に目を向けていました。その時の考え方は単純でした:AIが強ければ強いほど、人件費を節約し、より多くの利益を得られると。皆が前提としていたのは、「AIの価値 = その能力の上限」というものでした。

しかし2026年になると、方向性が完全に変わりました。記事によると、マイクロソフトが「Humanist AI Code of Conduct」の草案を発表し、PalantirやNvidiaなどの大手企業が最先端のモデルの使用を厳格に制限しています。これらは一見無関係に見えますが、実は同じ問題を指摘しています:企業はAIが賢すぎることを懸念しています。賢すぎると、センシティブな領域に侵入し、制御が難しくなるからです。

今の質問の仕方は以下のようになっています:

  • それは実際に何ができるのか?(その能力の境界はどこか?)
  • もし権限を与えられたら、それを実行すべきなのか?(権限と能力の分離)
  • サプライヤー自体が信頼できない場合、そのシステムは使えるのか?(信頼の対象の移行)

これは、以前は料理人の腕前だけを気にしていたのに、今では自分で食材を買い、料理をし、皿を洗い、さらには火をつけたり消したりできる「全能の執事」を雇うようなものです。今では、その執事が私の気づかない間に家を燃やしてしまうかどうかが問題になっています。つまり、私はいつでもその執事を止めることができるのかが重要になっています。

2. 概念の明確化:「賢さ」と「権限」は別物

核心的な見解: 以前はIntelligence(知能/能力)とAuthority(権限/認可)を混同していました。AIができることがあるからといって、それを許可すべきだとは限りません。

詳細な解説:

これは記事で最も重要な論点です。従来のソフトウェア時代(SaaS)では、コードは固定されていました。データベースが削除命令を実行すると、ただ削除するだけで、他のテーブルも一緒に消されることはありませんでした。その行動範囲が限られていたから、私たちはサプライヤーを信頼していました。しかしエージェント(Agent)は違います。エージェントは意図を理解し、目標を分解し、ツールを呼び出し、連続して動作します。それはまるで本物の「行動主体」のようです。

  • 能力(Intelligence): トレーニングによって得られます。例えば、AIエージェントがデータベースを削除する技術的な能力を持っていても、それが許可されていなければ実行されません。
  • 権限(Authority): 認可によって与えられます。例えば、SQLを理解していても、その瞬間にそのデータベースを削除する権限がなければ実行されません。

矛盾するのは、企業はAIにより多くの自律性を求めつつも、常に人間の制御下に置きたいという点です。もしすべての手順で人間の確認が必要なら、AIは単なる高度なアシスタントに過ぎません。しかし、人間の確認がなければAIは制御不能になる可能性があります。

したがって、業界はこれら二つを分ける必要があります。「できるかどうか」は技術的な問題であり、「実行する権限があるかどうか」はガバナンスの問題です。エージェントが支払いインターフェースの認証を持っていても、それがすべての支払いを実行するわけではありません。能力はトレーニングによって得られますが、権限は明確に与えられなければならず、範囲と有効期限が必要です。

3. 信頼の移行:「人を信じる」から「構造を信じる」へ

核心的な見解: 企業はもはや「絶対に信頼できる」AIサプライヤーを探すのではなく、サプライヤーが誤りを犯したり悪意を持ったりしてもシステムが対応できるような構造を設計するようになりました。

詳細な解説:

以前はOpenAIやAnthropicのような企業を信頼していました(データを悪用しないと)。これを「主体信頼」と呼びます。しかし今では、AIが扱うデータは非常に敏感です:ソースコード、セキュリティポリシー、顧客のプライバシー、意思決定ロジック、さらには操作の認証まで。AIサプライヤーは単なるツール提供者ではなく、企業の「認知インフラの提供者」になっています。

そのため、企業は単一の主体に対する信頼を無限に拡大することはできません。例えば、PalantirはAnthropicに「データを一切保持しない」という保証を求め、Nvidiaはモデルの使用範囲を制限しています。これらの動きの背後にあるのは「クラウドが安全でない」という理由ではなく、「単一の主体に対する依存を減らす」という考えです。

これは航空業や核工業と同じです。飛行機の安全性は「パイロットが絶対にミスしない」ことに依存しているのではなく、複数の冗長システムによって保たれています。パイロットがミスした場合は自動運転が引き継ぎ、センサーが故障した場合は予備のセンサーが機能します。AI業界も同様の進化を遂げています:「エージェントを信じる」から「構造を信じる」へと。

将来のアーキテクチャは「どのモデルが常に信頼できるか」ではなく、以下のようなことを問うでしょう:

  • どのモデルを使っても、どこまで進むことができるのか?
  • どの境界を自動的に変更できないのか?
  • モデルがハッキングされた場合、システムには最後の防御線があるのか?

これはより成熟した、より工学的な信頼観です:どの主体も完璧ではないと仮定し、その失敗に対応できるようなシステムを設計するのです。

4. ガバナンスの深化:「口を塞ぐ」から「手を制御する」へ

核心的な見解: AIは「情報システム」から「実行システム」へと変化しています。ガバナンスの焦点は「何を言ったか」から「何を実行したか」へと移っています。なぜなら、実行されるアクションはしばしば不可逆的だからです。

詳細な解説:

以前のAIガバナンスは主に「どのデータを使ってはいけないか」「どのプロンプトを使ってはいけないか」「どのような内容を生成してはいけないか」に集中していました。これはAIの出力が単なる「情報」であり、間違えたらやり直せるという前提に基づいていました。しかし今では、エージェントはメールを送ったり、コードを変更したり、APIを呼び出したり、資金を移動させたり、デバイスを制御したりします。これは「実行システム」に入ったことを意味します。

  • 情報レベルのエラー: 再実行することで対処できます。
  • 実行レベルのエラー: 金銭の損失やデータの消失、システムのダウンなど、重大な結果を招く可能性があります。

したがって、ガバナンスの焦点はモデルが悪いことを「考えているか」ではなく、実際に何をしたかに移る必要があります。人間の制御は単なるスローガンではなく、実際に検証可能な工程として実現されなければなりません:

  • モデルは停止するようになっていなければなりません。
  • モデルは自分の行動を隠してはなりません。
  • 継続的に実行されるタスクには明確な停止条件が必要です。

5. 最終的な洞察:AIを制限することが、AIを安全に使うための前提

核心的な見解: AIを「従順にする」だけでは不十分です。なぜなら、従順なAIが誤った命令を実行しても効率的だからです。本当の安全性は、「判断が間違っても『ノー』と言える」境界を設けることです。

詳細な解説:

これは記事で最も反直感的であり、最も深い結論です。業界全体がAIをより協調的で、より従順で、より幻想を持たないように努力しています。これはもちろん重要ですが、著者は「AIをより従順にするだけでは根本的な問題は解決しない」と指摘しています。

なぜかというと、従順さ自体が判断ミスを解決しないからです。例えば、間違った命令があっても、従順なAIはそれを効率的に実行してしまいます。管理者が誤操作をした場合、従順なAIは即座に実行してしまいます。また、悪意のあるプロンプトによって攻撃された場合、従順なAIはそれを正常な命令として実行してしまう可能性があります。

もしすべての行動に人間の確認が必要なら、AIは単なる高度なアシスタントに過ぎません。しかし、人間の確認がなければAIは制御不能になるかもしれません。

したがって、業界はこれら二つを分ける必要があります。「できるかどうか」は技術的な問題であり、「実行する権限があるかどうか」はガバナンスの問題です。エージェントが支払いインターフェースの認証を持っていても、それがすべての支払いを実行するわけではありません。能力はトレーニングによって得られますが、権限は明確に与えられなければならず、範囲と有効期限が必要です。

まとめ:

過去は「AIは信頼できるか?」と尋ねていましたが、未来は「AIが完全に信頼できなくても、安全に使用できるか?」と尋ねることになります。

これはAIを制限するように聞こえるかもしれませんが、実際にはAIを効果的に制御できるときにのみ、より重要なタスクを任せることができます。これこそがAIが大規模に導入され、実際のビジネス価値を生み出すための基石です。

一般の人々へのメッセージ:

もしあなたが企業でAIの導入を担当しているなら、「このモデルがどれだけ強いか」だけに注目するのではなく、ITチームやセキュリティチームに以下のような質問をしてください:

1. このAIはどのような重要なデータにアクセスできるのか?

2. もしデータベースを削除しようとしたら、誰がそれを止めることができるのか?

3. その各操作には独立したログやリカバリメカニズムがあるのか?

4. 私たちはこのサプライヤーに過度に依存していないか?バックアップ計画はあるのか?

「AIを信じる」から「AIを制限する」へ、これが2026年のAI時代の生存法則です。