虎嗅

**クロードのテキストウォーターマークが、人間の策略を見事にかいくぐった**

原文:Claude 的文字水印,成功把人类套路了

核心内容のまとめ

AnthropicがClaudeで生成したテキストには、Google SynthIDを基にした隠しウォータマークが施されており、その仕組みは生成時に単語選択の確率をこっそりと調整することで、検出ツールだけが認識できる統計的なパターンを形成するというものです。しかし、ウォータマークを除去するためのツール(例えば他のAIを使った「文章洗浄」)がすぐに登場し、このパターンを簡単に破壊できます。この技術的な攻防はウォータマークの脆弱性を露呈するだけでなく、より深刻な問題を引き起こしています。つまり、テキストの生成や修正がすべて「検出を避ける」ため、または「痕跡を残す」ために行われる場合、文章作成における単語の正確性やスタイルへの追求が技術的な目的によって圧迫されてしまっているのです。

1. Claudeの隠しウォータマークは「印をつける」のではなく、単語選択をこっそりと「誘導する」

ウォータマークとは記事を書き終えた後に隠れた記号を加えるものだと思っていませんか?違います。Claudeがテキストを生成する際には、各単語(または句読点など、「トークン」と呼ばれる)ごとに候補単語の確率を計算します。例えば「この映画は本当に____」という場合、「良い」が40%、「すごい」が20%、「素晴らしい」が10%などです。SynthIDは秘密のルールに従って、特定の単語の確率をわずかに高めます(例えば「良い」を45%に、「すごい」を18%に下げる)。これにより、モデルがこれらの単語を選ぶ可能性が高まります。

しかし、特定の単語を強制的に選ぶわけではなく、固定された「ウォータマーク単語リスト」もありません。同じ単語でも文脈によっては優先されることもあればそうでないこともあります。個々の単語だけを見ても異常はわかりませんが、数百語が蓄積された後でなければ、検出ツールは「このテキストの単語選択が常にその秘密のルールに従っている」と気づきます。まるで試験で生徒がいつもCを選ぶように、それは偶然ではなく「誘導」があるからです。

2. ウォータマークの除去が簡単な理由

ウォータマークはファイルのメタデータ(画像の撮影情報など)に隠されているわけでも、隠し文字を加えるわけでもありません。単純に単語選択に直接「書き込まれて」います。ウォータマークを除去するには、意味を変えずに単語を再選択すればよいのです。例えば同義語に置き換えたり(「良い」を「素晴らしい」に)、文形を変えたり(能動態から受動態に)、または別のAIに「文章洗浄」を依頼したりします。例えばDeclaudeというツールは元々「AIの痕跡を消す」ためのものですが、結果的にウォータマークの痕跡も一緒に消してしまいます。

作文を書くときに先生がこっそりと特定の単語の使用を促すようなもので、それを避けたい場合は、意味が似ている別の単語に置き換えればいいだけです。このような対抗策のコストは非常に低いため、Claudeのウォータマークは登場した瞬間に問題視されました。

3. 攻防の非対称性:隠れたい人は逃げられるが、正直な人はマークされる

このゲームは2つのグループにとって不公平です:

  • 不正をしようとする人:ウォータマークのないモデルや文章洗浄ツールを使い、何度も修正して検出されなくします。
  • 一般ユーザー:ウォータマークの存在を知らずにClaudeで生成したコンテンツを使用すると、ウォータマークが付いてしまい、「AIによる代筆」と誤解されやすくなります。

試験では、不正をする人は事前に先生の「誘導」を避ける方法を見つけますが、真剣に答える生徒は「先生の指示に従ってCを選んだ」ためにバレやすいのです。ウォータマークが最も簡単に検出されるのは、隠れようとしない人たちなのです。

4. 最も恐ろしいのは技術の失敗ではなく、テキスト表現が技術に「誘拐」されること

Anthropicはウォータマークが意味や品質に影響を与えないと主張していますが、問題はモデルが単語を選ぶ際に「検出されるかどうか」という新たな目標が加わり、「より正確でスタイリッシュに書く」ことだけを考えなくなってしまった点です。ユーザーも検出を避けるために単語を変更する際には、単語の微妙な違いを無視してしまいます。

例えば「彼はついに同意した」と「彼はついに折れた」は意味は似ていますが、「折れた」には「以前は抵抗して、何度も交渉した末に譲歩した」というニュアンスがあります。本当に文章作成を大切にする人にとって、これらの単語は簡単には置き換えられません。しかし今では、モデルもユーザーも「意味が似ている」という理由だけで単語を変更しています。テキストはもはや正確な表現のためだけのものではなく、技術的な攻防の「駒」となってしまっています。

この論争の結局のところ、問われているのはウォータマークが隠れているかどうかではなく、文章作成におけるスタイル、リズム、正確性への追求がまだ重視されるかどうかです。すべての人が技術的な目的のために単語を変更する中で、「この文は本来どのように書くべきか」ということが脇に追いやられてしまっています。

総括

Claudeのウォータマーク技術は一見先進的ですが、すぐに対抗策が出されました。より注目すべきは、テキストが技術的な対立の戦場に変わってしまったことです。テキストはもはや表現のためだけのものではなく、「痕跡を残す」か「痕跡を隠す」という目的も考慮しなければならなくなりました。これは私たちに思い出させます:技術が発展する中で、テキスト自体の価値を忘れてはなりません。結局のところ、単語の選択は「意味が似ていればいい」というだけではありません。それ自体が意味の一部なのです。