虎嗅

**클로드의 텍스트 워터마크가 인간의 전략을 성공적으로 속였다**

原文:Claude 的文字水印,成功把人类套路了

핵심 내용 요약

Anthropic이 Claude가 생성한 텍스트에 적용한 마크는 Google SynthID를 기반으로 하며, 이 마크는 텍스트를 생성할 때 단어 선택의 확률을 조정함으로써 감지 도구만이 인식할 수 있는 패턴을 만드는 방식입니다. 그러나 반마크링 도구(예: 다른 AI를 사용한 텍스트 수정 도구)가 등장하면서 이러한 패턴을 쉽게 파괴할 수 있게 되었습니다. 이 기술적 공방전은 마크의 취약성을 드러내는 것뿐만 아니라, 텍스트 생성과 수정이 모두 “감지를 피하거나 흔적을 남기기” 위한 목적으로 이루어질 때 작문에서의 단어 정확성과 스타일에 대한 추구가 기술적 목표에 의해 억압되고 있다는 심각한 문제를 제기합니다.

1. Claude의 마크는 “도장 찍기”가 아니라, 단어 선택을 “조용히 유도하는” 것

마크가 글을 쓴 후에 숨겨진 기호로 추가되는 것이라고 생각하실 수 있지만 사실은 그렇지 않습니다. Claude가 단어를 생성할 때마다(또는 구두점을 포함하여, 이를 “토큰(token)”이라고 합니다.) 여러 후보 단어의 확률을 계산합니다. 예를 들어, “이 영화는 정말 ____”이라는 문장에서 “좋아요”가 40%, “대단해요”가 20%, “흥미롭네요”가 10%의 확률을 가집니다. SynthID는 일련의 비밀 규칙에 따라 특정 단어의 확률을 약간 높여서(예: “좋아요”를 45%로, “대단해요”를 18%로) 모델이 이러한 단어들을 선택하도록 유도합니다.

하지만 모델은 특정 단어를 강제로 선택하지 않으며, 고정된 “마크 단어 목록”도 없습니다. 같은 단어라도 문맥에 따라 다르게 선택될 수 있습니다. 개별 단어만 보면 아무런 이상이 없지만, 수백 개의 단어가 누적되면 감지 도구는 “이 텍스트의 단어 선택이 항상 그 비밀 규칙에 따른 패턴을 따른다”는 것을 발견할 수 있습니다. 마치 시험에서 어떤 학생이 계속해서 C를 선택하는 것처럼, 이는 우연이 아니라 의도적인 “유도”의 결과입니다.

2. 반마크링이 쉬운 이유는 마크가 텍스트와 너무 밀접하게 연결되어 있기 때문

마크는 파일 메타데이터(예: 이미지의 촬영 정보)에 숨겨져 있거나 숨겨진 문자로 추가되는 것이 아니라, 단어 선택 과정 자체에 직접 “쓰여” 있습니다. 마크를 제거하려면 문장의 의미를 바꾸지 않으면서 단어만 다시 선택하면 됩니다: 동의어로 바꾸거나(“좋아요”를 “흥미롭네요”로), 문장형을 바꾸거나, 또는 다른 AI에게 텍스트를 수정시키면 됩니다(예: Declaude라는 도구는 원래 AI의 흔적을 제거하기 위한 것이었지만, 마크도 함께 제거해버릴 수 있습니다.).

마치 선생님이 글을 쓸 때 특정 단어를 사용하도록 은근히 유도하는 것과 같습니다. 이러한 반제압의 비용이 매우 낮기 때문에 Claude의 마크는 등장하자마자 문제가 되었습니다.

3. 공방전의 불균형: 속이려는 사람은 잘 피하지만, 정직한 사람은 오히려 마크에 걸린다

이 기술적 공방전은 두 가지 유형의 사람에게 불공평합니다:

  • 부정행위를 하려는 사람들: 비마크 모델이나 텍스트 수정 도구를 사용하여 감지되지 않도록 반복적으로 수정합니다.
  • 일반 사용자: 마크의 존재를 모르고 Claude를 사용하여 내용을 생성하면 마크에 걸려서 AI가 대신 쓴 것으로 오해받기 쉽습니다.

시험에서 부정행위를 하는 사람은 선생님의 유도를 피하기 위한 방법을 미리 찾지만, 성실하게 답변하는 학생은 선생님이 시사한 대로 C를 선택함으로써 오히려 적발됩니다. 마크가 가장 쉽게 발견되는 것은 속이려고 하지 않는 사람들입니다.

4. 가장 무서운 것은 기술의 실패가 아니라, 텍스트 표현이 기술에 의해 “납치”되는 것

Anthropic은 마크가 의미와 질에 영향을 미치지 않는다고 주장하지만, 문제는 모델이 단어를 선택할 때 “감지될 수 있는지”라는 새로운 목표가 생겼기 때문입니다. 이제는 “어떻게 더 정확하고 스타일리시하게 쓸 것인가”만 고려하는 것이 아니라, 감지를 피하기 위해 단어를 수정하게 됩니다.

예를 들어, “그는 마침내 동의했다”와 “그는 마침내 양보했다”는 의미가 비슷하지만, “양보했다”는 “이전에 거부하다가 견디다가 결국 동의했다”는 뉘앙스를 가집니다. 진정으로 글쓰기를 중시하는 사람에게는 이 두 단어를 함부로 바꿀 수 없습니다. 하지만 지금은 모델이든 사용자든 “의미가 비슷하다”는 이유로 단어를 수정합니다. 텍스트는 더 이상 정확한 표현을 위한 것이 아니라 기술적 공방전의 도구가 되어 버렸습니다.

결론

Claude의 마크 기술은 첨단해 보이지만, 빠르게 반제압을 받았습니다. 더 주목해야 할 것은 이 기술이 텍스트를 기술적 대결의 장으로 만들었다는 점입니다. 텍스트는 더 이상 단지 의사소통을 위한 도구가 아니라, “흔적을 남기거나 피하는” 목적도 고려해야 하게 되었습니다. 이는 기술이 발전할 때 텍스트 자체의 가치를 잊어서는 안 된다는 것을 상기시켜 줍니다. 결국, 단어 선택은 단지 “의미가 비슷하면 되는” 것이 아니라 그 자체로 의미의 일부입니다.