虎嗅

Claude 的文字水印,成功把人类套路了

核心内容总结

Anthropic给Claude生成的文本加了基于Google SynthID的隐形水印,原理是生成时悄悄调整词语选择的概率,形成只有检测工具能识别的统计规律;但反水印工具(比如用其他AI“洗稿”)很快出现,能轻松破坏这种规律。这场技术攻防不仅暴露了水印的脆弱性,更引发了一个深层问题:当文字生成和修改都为了“躲检测”或“留痕迹”时,写作中对词语精准性、风格的追求,正在被技术目标挤压。

一、Claude的隐形水印不是“盖戳”,是偷偷“引导”词语选择

你以为水印是写完文章后加个隐藏符号?不是的。Claude生成文字时,每写一个词(或标点,叫“token”),都会先算一堆候选词的概率,比如“这部电影真____”,候选词里“好看”40%、“厉害”20%、“精彩”10%。SynthID做的是:按一套秘密规则,轻微提高某些词的概率(比如把“好看”提到45%,“厉害”降到18%),让模型更可能选这些词。

但它不会强迫选某词,也没有固定的“水印词表”——同一词在不同上下文里,可能被偏爱也可能不。单独看一个词,人根本看不出异常;只有累积几百个词后,检测工具才能发现“这个文本的词语选择,总是符合那套秘密规则的统计偏好”,就像考试时某学生总偏选C,不是巧合,而是有“引导”。

二、反水印为啥这么容易?因为水印和文字绑得太紧了

水印不是藏在文件 metadata(比如图片的拍摄信息)里,也不是加隐形字符,而是直接“写”在词语选择里。想去掉它,只要在不改变大意的前提下,重新选一遍词就行:换同义词(“好看”改“精彩”)、改语态(主动变被动),或者直接扔给另一个AI“洗稿”——比如工具Declaude本来是用来“去AI味儿”的,结果顺手就把水印痕迹抹掉了。

就像你写作文时,老师偷偷让你偏用某些词,你想躲过去,只要把这些词换成意思差不多的就行,老师的“引导”痕迹就没了。这种反制成本极低,所以Claude的水印刚出来就尴尬了。

三、攻防不对称:想躲的人能溜,老实人反而被标记

这场游戏对两类人不公平:

  • 想作弊的人:会主动找非水印模型、洗稿工具,反复改到检测不出来;
  • 普通用户:可能不知道水印存在,默认用Claude生成内容,结果被水印标记,容易被误认为“AI代写”。

就像考试时,作弊的人会提前找方法避开老师的“引导”,而认真答题的学生反而因为“按老师暗示选C”被抓——水印最容易标记的,恰恰是那些没想躲的人。

四、最可怕的不是技术失效,是文字表达被技术“绑架”

Anthropic说水印不影响语义和质量,但问题在于:模型选词时,多了一个“能不能被检测到”的目标,不再只考虑“怎么写更准确、更有风格”;用户反制时,也会为了“躲检测”改词,忽略词语的细微差别。

比如“他终于答应了”和“他终于松口了”,意思差不多,但“松口”多了“之前抗拒、经过拉扯才让步”的味道。对真正在意写作的人来说,这两个词不能随便换。但现在,不管是模型还是用户,都把“意思差不多”当成改词的理由——文字不再是为了精准表达,而是成了技术攻防的“棋子”。

这场争执到最后,争的不是水印隐不隐形,而是:写作中那些关于风格、节奏、精准性的追求,还能不能被重视?当所有人都在为技术目标改词时,“这句话本来该怎么写”,已经被挤到角落了。

总结

Claude的水印技术看似先进,却很快被反制;更值得关注的是,它把文字变成了技术对抗的战场——文字不再只为表达服务,而是要兼顾“留痕迹”或“躲痕迹”。这提醒我们:技术发展时,不能忘了文字本身的价值,毕竟,词语的选择从来不是“意思差不多就行”,它本身就是意思的一部分。