虎嗅

【翻訳後の日本語ヘッドライン】 侵入の防止から予測不可能性の制御まで:AIがセキュリティの基本問題を書き換えている

原文:从防止入侵,到约束不可预测性:AI 正在改写安全的基本问题

核心内容のまとめ

過去30年間、サイバーセキュリティの焦点は「外部からの不正侵入の防止」にありました。ファイアウォールや権限管理などを用いて、許可されていない人やプログラムが悪さをするのを防いできました。しかし、AIエージェントの登場により状況は一変しました。AIエージェントには合法的なアイデンティティと権限がありますが、その「不確実性」(行動を正確に予測できないこと)から、完全にコンプライアンスを守りながらも「善意で悪い結果を招く」可能性があります。将来のセキュリティの焦点は、「誰が何ができるか」ではなく、「その行動が取り返しのつかない結果を引き起こすかどうか」に移ります。AIから独立した「実行制限」を設け、AIが間違えた場合でもその影響をコントロールできるようにする必要があります。

1. なぜ過去のセキュリティ対策は効果的だったのか?それはシステムが「絶対的」だったから

従来のソフトウェアは精密な機械のようでした。同じ入力と状態であれば、必ず同じ結果になります。例えば、「データベースを読み取る」という命令を与えれば、データを変更することはありませんし、削除権限のないアカウントではファイルを削除できません。このような「確実性」により、セキュリティ規則を明確に定めることができました。「何ができるか」をはっきりさせれば、「何をするか」を管理できたのです。

しかし、AIエージェントは異なります。固定されたプロセスに従うのではなく、「柔軟なアシスタント」のように振る舞います。目標を達成するように指示すれば、10通りもの異なる方法を考え出したり、使うツールの組み合わせがこれまで見たことがないものになったりします。入力がほぼ同じでも、その推論や計画は変わる可能性があります。これにより、権限は「何をするか」を証明するだけで、「正しく行動するか」を保証することはできません。セキュリティの問題は「できるかどうか」から「すべきかどうか」へと本質的に変わりました。

2. 最も恐ろしいのはハッカーではなく、AIが「合法的に間違えること」

現在、AIセキュリティについて議論する際には、「モデルが攻撃される」「データが漏洩する」といった従来のセキュリティの考え方で「悪者」を探しています。しかし、より厄介なのは悪者がおらず、AIもハッキングされていないにもかかわらず、「単純に判断を誤る」というケースです。

例えば、会社がAIにクラウドサーバーの障害を自動的に処理させます。AIにはサービスを再起動したりリソースを削除するための合法的な権限があります。ある日、AIは異常を検出し、迅速に復旧するために「再生成可能だと思われる」リソースを削除します。しかし、そのリソースは他のサービスに依存しており、削除された結果システム全体が崩壊しました。すべての従来のセキュリティチェックに合格していました(アイデンティティは合法で権限も一致しています)が、事故は発生しました。

従来のセキュリティは「できるかどうか」しか答えませんでしたが、AI時代のセキュリティでは「今行動すべきか」という問いに答えなければなりません。これら2つの問いは以前は重なっていましたが、今では完全に分かれています。

3. AIは「理論的な話し合い」から「実際の行動」へと進化し、リスクが現実化

大規模なAIモデルが登場した当初は、誤ったテキストを出力する程度でした(例えば無意味な内容)。しかし、人間がそれをチェックして問題を防ぐことができました。しかし、AIエージェントはAPIを呼び出したり、お金を移動させたり、データベースを削除したり、デバイスを制御したりすることができます。これにより不確実性に「実行権」が生じました。

これは、「私は送金します」と言うだけの人と実際に送金する人の違いです。AIの判断は確率的なものです(例えば90%の信頼度であっても)、しかし実際の操作は「成功か失敗か」の二者択一です。データは削除されるか、そうでないかのどちらかです。AIは後悔することができますが、現実では「取り消す」ことはできません。したがって、セキュリティの焦点は「AIの正確性を高める」ことから、「実行結果をコントロールする」ことへと移らなければなりません。AIが間違えた場合でも、取り返しのつかない事態にならないようにしなければなりません。

4. セキュリティで防ぐべきは「悪意」ではなく、「合理的な誤り」

従来のセキュリティは「悪意のあるコード」「ハッカー」「アカウントの盗用」に焦点を当てていました。しかし、AIのリスクには悪意が全くない場合もあります。AIはタスクを真剣に理解し、手順を合理的に計画し、権限を厳守していますが、「文脈を誤解したり」「ツールから異常なデータが返されたり」「他のAIとの連携で問題が発生したり」することで間違える可能性があります。

さらに厄介なのは、賢いAIが犯す間違いが「合理的に見える」という点です。例えば、データを削除する前に「論理的に一貫した報告書」を提供し、なぜ削除する必要があるかを説明しますが、問題があることに気づかない場合もあります。このような場合、AIに自己チェックさせるのではなく、独立した第三者による判断が必要です。

5. 未来のセキュリティ:AIは間違えることを前提とし、その結果を制限する

航空業や原子力産業は既にこの考え方を理解しています。エンジンが永遠に故障しないとは期待せず、「故障後に爆発しない」システムを設計します。AIセキュリティも同様です。成熟したアーキテクチャは「AIが常に正しい」とは仮定せず、AIが間違えることを前提に、「その誤りが災害を引き起こすかどうか」を問います。

例えば、AIが直接生産環境を変更できるのか?一度にすべてのお金を移動させることができるのか?危険な操作を行う前に「最終的なチェックポイント」(AIから独立したシステム)があるのか?このような「実行制限」には2つの条件が必要です:

1. 対抗性:判断するシステムとAIは異なるものであり、同じ間違いを犯さない。

2. 完全性:すべての実行パスをカバーし、漏れがないようにする(AIはカバーされていないルートを見つけ出す可能性がある)。

簡単に言えば、未来のセキュリティの目標は「AIが間違えないようにする」ではなく、「AIが間違えたとしても大混乱を引き起こさないようにする」ことです。

結論

過去30年間、私たちは「悪者がシステムに侵入するのを防ぐ」ために努力しました。しかし、未来では同じ時間をかけて「良いAIが間違えるのを防ぐ」必要があるかもしれません。AIが現実世界を直接操作できるようになったとき、セキュリティの焦点は「誰が何ができるか」ではなく、「その行動が最終的にどのような結果になるか」に移ります。これはAIが「ツール」から「インフラストラクチャー」へと進化するための必然的な過程です。