虎嗅

**La « watermark » de texte de Claude a réussi à tromper les humains.**

原文:Claude 的文字水印,成功把人类套路了

Résumé des principaux points

Le texte généré par Anthropic pour Claude contient une watermark invisible basée sur Google SynthID. Ce système modifie discrètement les probabilités de sélection des mots lors de la génération du texte, créant ainsi des schémas statistiques reconnaissables uniquement par des outils de détection. Cependant, des outils anti-watermark (tels que d'autres technologies d'éditation par intelligence artificielle) ont rapidement vu le jour et peuvent facilement neutraliser ces modifications. Cette bataille technologique met en évidence la vulnérabilité des watermarks, mais soulève également une question plus profonde : lorsque la création et la modification du texte visent à éviter les détecteurs ou à laisser des traces, la précision des mots et le style de l'écriture sont compressés par les objectifs techniques.

I. La watermark invisible de Claude n'est pas un simple « tampon », mais guide secrètement le choix des mots

Pensez-vous qu'une watermark est juste un symbole caché ajouté après la rédaction d'un article ? Non. Lorsque Claude génère du texte, pour chaque mot (ou ponctuation, appelé « token »), il calcule les probabilités de différents mots candidats. Par exemple, pour l'expression « ce film est vraiment ____, » les mots « beau » (40 %), « impressionnant » (20 %) et « spectaculaire » (10 %) sont proposés comme options. SynthID augmente légèrement la probabilité de certains mots en suivant des règles secrètes (par exemple, en augmentant celle de « beau » à 45 % et en réduisant celle de « impressionnant » à 18 %), incitant le modèle à choisir ces mots.

Cependant, le système n'impose pas la sélection d'un mot particulier et ne dispose pas d'une liste fixe de mots watermark. Un même mot peut être privilégié ou non selon le contexte. Séparément, il est impossible de détecter une anomalie ; ce n'est qu'après l'accumulation de plusieurs centaines de mots que les outils de détection peuvent remarquer que le choix des mots suit ces règles statistiques secrètes. C'est comme si un étudiant choisissait systématiquement la réponse « C » lors d'un examen : ce n'est pas une coïncidence, mais le résultat d'une influence invisible.

II. Pourquoi les anti-watermark sont-ils si faciles à utiliser ?

La raison en est que la watermark est étroitement liée au texte généré. Elle n'est pas cachée dans les métadonnées des fichiers (comme les informations de prise de vue d'une image), ni représentée par des caractères invisibles, mais est directement intégrée au processus de sélection des mots. Pour l'éliminer, il suffit de choisir à nouveau les mots en conservant le sens global du texte : utiliser des synonymes (par exemple, remplacer « beau » par « spectaculaire »), changer de voix (passer d'une forme active à une passive), ou de confier le texte à un autre outil d'édition par intelligence artificielle (comme Declaude, conçu pour enlever l'aspect artificiel du texte). C'est comme si, lors d'un devoir, l'enseignant vous incitait secrètement à utiliser certains mots ; pour y échapper, il suffit de les remplacer par des alternatives ayant un sens similaire, et la trace de cette influence disparaît.

III. Asymétrie dans la lutte technologique : ceux qui cherchent à tricher s'en sortent, tandis que les utilisateurs honnêtes sont marqués

Cette situation est injuste pour deux types de personnes :

  • Ceux qui veulent tricher : ils utilisent des modèles ou des outils anti-watermark pour modifier le texte jusqu'à ce qu'il ne soit plus détectable.
  • Les utilisateurs ordinaires : qui ignorent l'existence des watermarks et utilisent Claude par défaut se voient marqués comme ayant écrit leur texte avec une aide artificielle, ce qui peut les faire passer pour des rédactions générées par une intelligence artificielle.

C'est comme lors d'un examen : ceux qui trichent trouvent des moyens de contourner l'influence de l'enseignant, tandis que les étudiants sérieux sont repérés pour avoir choisi la réponse « C » sur ses indications. Les watermarks touchent principalement ceux qui ne cherchent pas à se cacher.

IV. Le pire n'est pas l'échec de la technologie, mais le fait que l'expression écrite soit « enlevée » par elle

Anthropic affirme que les watermarks n'affectent ni le sens ni la qualité du texte, mais le problème est qu'elles imposent un nouvel objectif aux modèles : vérifier si le texte peut être détecté. Les utilisateurs doivent également modifier leurs choix de mots pour éviter les détecteurs, négligeant ainsi les subtiles différences entre eux. Par exemple, les expressions « il a finalement accepté » et « il a finalement cédé » ont un sens similaire, mais « cédé » implique une résistance préalable et des négociations. Pour ceux qui se soucient vraiment de l'écriture, ces mots ne peuvent pas être remplacés à la légère. Or, maintenant, que ce soit les modèles ou les utilisateurs, ils utilisent le fait que les significations soient similaires comme prétexte pour modifier leur texte. Le but du texte n'est plus l'expression précise, mais de devenir un outil dans ces luttes technologiques.

Au final, la question n'est pas de savoir si les watermarks sont visibles ou non, mais de savoir si les aspirations à la qualité stylistique et à la précision de l'écriture peuvent encore être respectées. Lorsque tout le monde modifie son texte pour répondre aux exigences technologiques, la manière naturelle de s'exprimer est reléguée au second plan.

Conclusion

La technologie de watermark de Claude semble avancée, mais elle a été rapidement contournée. Plus important encore, elle a transformé l'écriture en un champ de bataille technologique : le texte n'est plus utilisé uniquement pour communiquer, mais aussi pour laisser des traces ou éviter d'en laisser. Cela nous rappelle que le développement technologique ne doit pas oublier la valeur intrinsèque du langage. Après tout, le choix des mots n'a jamais été simplement une question de similarité de sens ; ils font partie intégrante de la signification elle-même.