虎嗅

**Текстовый водяной знак Клода успешно обманул людей.**

原文:Claude 的文字水印,成功把人类套路了

Краткое содержание анализа

Компания Anthropic добавила в текст, сгенерированный моделем Claude, скрытый водяной знак на основе технологии Google SynthID. Принцип работы этого знака заключается в том, что при генерации текста незаметно изменяются вероятности выбора слов, создавая статистические закономерности, улавливаемые только специальными инструментами для обнаружения водяных знаков. Однако вскоре появились инструменты для удаления таких знаков (например, другие AI-системы для очистки текста), которые легко нарушают эти закономерности. Эта техническая борьба не только выявила уязвимости водяных знаков, но и подняла более глубокий вопрос: когда процесс создания и изменения текста направлен на избежание обнаружения или оставление следов, стремление к точности выбора слов и стилю письма подавляется техническими требованиями.

I. Скрытый водяной знак Claude не является простым “печатью”; он “направляет” выбор слов

Вы думаете, что водяной знак — это просто скрытый символ, добавляемый после написания статьи? Нет. При генерации текста модель Claude для каждого слова (или знака пунктуации) рассчитывает вероятности использования различных вариантов. Например, для фразы “Этот фильм действительно ____” вероятность использования слова “хорош” составляет 40%, “замечательный” — 20%, а “впечатляющий” — 10%. Технология SynthID увеличивает вероятность использования некоторых слов (например, до 45% для “хорош”) и снижает вероятность других (до 18%), тем самым влияя на выбор моделью.

Однако модель не заставляет использовать определенные слова, и нет фиксированного списка “водяных знаков”: одно и то же слово может быть предпочтено в одном контексте и отклонено в другом. При рассмотрении отдельных слов человек не заметит никаких аномалий; только после сбора нескольких сотен слов специальные инструменты могут обнаружить, что выбор слов соответствует определенным статистическим закономерностям. Это похоже на ситуацию, когда ученик на экзамене систематически выбирает вариант ответа “C” — это не случайность, а результат влияния некоторых факторов.

II. Почему удаление водяных знаков такое простое? Потому что они слишком тесно связаны с текстом

Водяные знаки не скрыты в метаданных файлах (например, информации об изображении) или представлены в виде невидимых символов; они просто “встроены” в процесс выбора слов. Чтобы их удалить, достаточно заменить слова на синонимы, изменить формулировку или передать текст другой AI-системе для обработки (например, системе Declaude, предназначенной для устранения “искусственного” стиля текста). Это делает процесс удаления водяных знаков крайне простым.

III. Асимметрия в технической борьбе: те, кто хочет обмануть, могут это сделать, а честные пользователи оказываются маркированными

Эта ситуация несправедлива по отношению к двум группам людей:

  • Те, кто хочет обмануть: используют модели или инструменты, не содержащие водяных знаков, и могут несколько раз изменять текст, чтобы их нельзя было обнаружить;
  • Обычные пользователи: возможно, даже не знают о существовании водяных знаков и используют модель Claude для создания контента, в результате чего их текст маркируется как авторства AI.

Это похоже на ситуацию на экзамене: те, кто списывает, заранее находят способы избежать влияния учителя, а студенты, которые серьезно отвечают на вопросы, могут быть пойманы за использование предпочтительных вариантов ответов. Водяные знаки легко обнаруживаются именно у тех, кто не пытается их скрыть.

IV. Самое страшное не сбой технологии, а “похищение” способности к письму

Компания Anthropic утверждает, что водяные знаки не влияют на семантику и качество текста, но проблема в том, что при выборе слов модель учитывает также возможность их обнаружения. В результате пользователи при попытке избежать обнаружения изменяют формулировки, игнорируя нюансы значения слов. Например, фразы “Он наконец согласился” и “Он наконец смягчил свою позицию” имеют похожее значение, но вторая формулировка передает дополнительную информацию о процессе принятия решения. Для тех, кто действительно ценит качество письма, такие различия важны. Однако сейчас и модели, и пользователи используют похожее значение слов как оправдание для изменений формулировок; текст больше не служит цели точного выражения мыслей, а становится инструментом в технической борьбе.

Вывод

Технология водяных знаков Claude, казалось бы, продвинута, но она быстро нашла противодействие. Более серьезной проблемой является то, что она превращает процесс письма в поле технического противостояния: текст больше не служит для передачи информации, а должен учитывать потребности в оставлении следов или их скрытии. Это напоминает нам, что при развитии технологий мы не должны забывать о ценности самого текста. Ведь выбор слов всегда имеет значение для передачи смысла, и он сам по себе является частью этого смысла.