虎嗅

**„Claudes Text-Wasserzeichen“ haben die Menschen erfolgreich überlistet**

原文:Claude 的文字水印,成功把人类套路了

Zusammenfassung der Kerninhalte

Anthropic fügte dem von Claude generierten Text einen unsichtbaren Wasserstoffaufdruck auf Basis von Google SynthID hinzu. Der Grund dafür ist, dass bei der Generierung der Wahrscheinlichkeiten für die Wortauswahl heimlich angepasst werden, wodurch statistische Muster entstehen, die nur durch spezielle Detektionswerkzeuge erkannt werden können. Allerdings erschienen schnell Anti-Wasserstoffaufdruck-Tools (z. B. andere AI-Systeme zur „Reinigung“ von Texten), die diese Muster mühelos zerstören konnten. Diese technische Auseinandersetzung hat nicht nur die Schwäche der Wasserstoffaufdrücke offenbart, sondern auch eine tiefere Frage aufgeworfen: Wenn sowohl die Erstellung als auch die Änderung von Texten darauf abzielen, „Detektionen zu umgehen“ oder „Spuren zu hinterlassen“, wird der Anspruch an die Genauigkeit und den Stil der Wortwahl im Schreiben durch technische Ziele unterdrückt.

Erstens: Claudes unsichtbarer Wasserstoffaufdruck ist keine „Stempelung“, sondern eine heimliche „Führung“ der Wortauswahl

Glauben Sie, ein Wasserstoffaufdruck besteht darin, nach dem Schreiben eines Artikels ein verstecktes Symbol hinzuzufügen? Nein. Wenn Claude Texte generiert, berechnet er für jedes geschriebene Wort (oder Zeichen, genannt „Token“) die Wahrscheinlichkeiten einer Reihe von möglichen Alternativen. Zum Beispiel bei der Beschreibung eines Films: „Dieser Film ist wirklich ____“. Unter den möglichen Optionen „hübsch“ (40 %), „beeindruckend“ (20 %) und „faszinierend“ (10 %). SynthID erhöht dann die Wahrscheinlichkeit bestimmter Wörter leicht gemäß einer geheimen Regel – zum Beispiel auf 45 % für „hübsch“ und senkt sie auf 18 % für „beeindruckend“ –, sodass das Modell eher diese Wörter wählt.

Allerdings zwingt es das Modell nicht, ein bestimmtes Wort auszuwählen, und es gibt keine feste Liste von „Wasserstoffaufdruck-Wörtern“. Das gleiche Wort kann in verschiedenen Kontexten bevorzugt oder ignoriert werden. Ein einzelnes Wort allein zeigt keinen Anomalieeffekt; erst nach der Generierung von Hunderten von Wörtern können Detektionswerkzeuge feststellen, dass die Wortwahl des Textes stets den statistischen Vorlieben dieser geheimen Regel entspricht – ähnlich wie bei einem Schüler, der immer die Antwort „C“ wählt; das ist kein Zufall, sondern auf eine „Führung“ durch das System zurückzuführen.

Zweitens: Warum sind Anti-Wasserstoffaufdrücke so einfach zu entfernen? Weil der Wasserstoffaufdruck zu eng mit dem Text verbunden ist

Der Wasserstoffaufdruck befindet sich nicht in den Metadaten des Files (z. B. Informationen zur Aufnahme eines Bildes) oder besteht aus unsichtbaren Zeichen, sondern wird direkt in die Wortauswahl integriert. Um ihn zu entfernen, genügt es, die Wörter unter Beibehaltung der Gesamtbedeutung neu auszuwählen: Synonyme zu verwenden („hübsch“ durch „faszinierend“ zu ersetzen), den Satzmodus zu ändern (von aktiv in passiv) oder den Text an ein anderes AI-System zur „Reinigung“ weiterzugeben – zum Beispiel Declaude, das ursprünglich dazu entwickelt wurde, den „AI-Eindruck“ von Texten zu entfernen.

Es ist vergleichbar damit, wenn Ihr Lehrer heimlich vorschreibt, bestimmte Wörter in Ihrer Aufgabe zu verwenden. Um dieser Vorgabe zu entgehen, müssen Sie diese Wörter einfach durch ähnliche ersetzen – dann verschwindet die „Führung“ des Lehrers. Der Aufwand für solche Gegenmaßnahmen ist sehr gering, weshalb Claudes Wasserstoffaufdruck schnell als problematisch erkannt wurde.

Drittens: Asymmetrie zwischen Angriff und Verteidigung: Diejenigen, die ausweichen wollen, schaffen es, während ehrliche Nutzer markiert werden

Dieses Spiel ist für zwei Gruppen von Menschen unfair:

  • Diejenigen, die betrügen wollen: Sie suchen aktiv nach Modellen oder Tools, die den Wasserstoffaufdruck nicht erkennen, und ändern den Text so lange, bis keine Spuren mehr vorhanden sind.
  • Normale Nutzer: Sie wissen möglicherweise nicht von der Existenz des Wasserstoffaufdrucks und verwenden Claude standardmäßig zur Texterstellung. Dadurch werden ihre Inhalte mit dem Wasserstoffaufdruck versehen, was dazu führen kann, dass sie fälschlicherweise als „von AI verfasst“ angesehen werden.

Ähnlich wie bei Prüfungen: Betrüger finden im Voraus Methoden, um die Anweisungen des Lehrers zu umgehen, während ernsthafte Schüler dadurch auffallen, dass sie aus Versehen die vorgeschlagenen Antworten wählen – genau diejenigen, die nicht versuchen, sich zu verstecken, werden am leichtesten erkannt.

Viertens: Das Schlimmste ist nicht der Versagen der Technologie, sondern die „Entführung“ der sprachlichen Ausdrucksweise durch Technologie

Anthropic behauptet, dass der Wasserstoffaufdruck die Semantik und Qualität des Textes nicht beeinträchtigt. Das Problem liegt jedoch darin, dass das Modell bei der Wortwahl nun auch das Kriterium „Kann der Text von Detektionswerkzeugen erkannt werden?“ berücksichtigen muss – anstatt nur darauf zu achten, wie genau und stilvoll der Text formuliert ist. Auch Nutzer ändern ihre Wörter, um „Detektionen zu vermeiden“, wobei sie die feinen Unterschiede zwischen den Worten ignorieren.

Beispielsweise bedeuten „Er hat schließlich zugestimmt“ und „Er hat schließlich nachgegeben“ im Grunde dasselbe, aber „nachgegeben“ vermittelt den Eindruck von Widerstand und einem langen Verhandlungsprozess. Für diejenigen, denen das Schreiben wirklich wichtig ist, können diese beiden Ausdrücke nicht einfach ausgetauscht werden. Doch heute betrachten sowohl Modelle als auch Nutzer „Ähnlichkeit der Bedeutungen“ als Grund für Änderungen – der Text dient nicht mehr der genauen Kommunikation, sondern wird zu einem Mittel im technischen Kampf.

Letztendlich geht es bei dieser Debatte nicht darum, ob Wasserstoffaufdrücke sichtbar oder unsichtbar sind, sondern darum, ob die Anstrengungen nach Stil, Rhythmus und Genauigkeit beim Schreiben weiterhin gewürdigt werden. Wenn alle nur noch aus technischen Gründen Wörter ändern, rückt der ursprüngliche Zweck des Schreibens in den Hintergrund.

Fazit

Claudes Wasserstoffaufdruck-Technologie scheint fortschrittlich zu sein, wurde aber schnell durch Gegenmaßnahmen überwunden. Noch bedeutsamer ist jedoch, dass sie den Text in einen Schauplatz technischer Konflikte verwandelt hat – der Text dient nicht mehr nur der Kommunikation, sondern muss auch die Bedürfnisse nach „Spuren hinterlassen“ oder „Spuren vermeiden“. Dies erinnert uns daran: Bei der Entwicklung von Technologie dürfen wir den Wert des Textes selbst nicht vergessen. Schließlich ist die Wahl der Wörter nie nur eine Frage der Ähnlichkeit der Bedeutungen; sie sind ein integraler Bestandteil der Botschaft selbst.