虎嗅

한국어 번역: 보이지 않는 AI 워터마크 때문에 Anthropic가 또다시 악당이 되었다

原文:因为一枚看不见的AI水印,Anthropic又成了大反派

핵심 내용 요약

Anthropic(Claude의 모회사)은 Claude가 생성한 모든 텍스트, 이미지, 파일에 보이지 않는 AI 워터마크를 추가했습니다(유럽 연합의 규제에 대응하고 업계 발언권을 잡기 위함). 그러나 이 워터마크는 출시 3일 만에 GitHub의 오픈소스 도구인 watermarks-remover에 의해 해독되었습니다. 이 도구는 텍스트 내의 패턴을 제거하고 파일 메타데이터를 삭제하며, 이미지의 워터마크까지 제거할 수 있습니다. 이 “워터마크 공방전”의 배경에는 사용자들의 모순된 요구사항이 있습니다: 한편으로는 AI 생성 콘텐츠를 식별하여 사기를 방지하고자 하지만, 다른 한편으로는 자신이 AI의 도움을 받아 만든 작품에 “전체가 AI로 생성됨”이라는 라벨이 붙여져 자신의 노동 가치가 부정되는 것을 원하지 않습니다.

1. Claude의 워터마크: 콘텐츠에 숨겨진 “보이지 않는 문신”, 어떻게 추가되었나?

Claude의 워터마크는 육안으로 보이는 로고나 텍스트가 아니라, 생성 과정에서 생성되는 패턴입니다.

AI가 텍스트를 생성할 때는 마치 “단어 연결 게임”과 같습니다: 각 단어를 선택할 때 가능성이 가장 높은 단어(예: “성장 속도가 매우 XX”)가 선택됩니다. 워터마크가 추가되면 Claude는 특정 단어의 선택 확률을 조정합니다(예: “빠름”의 확률을 약간 높이고 “신속함”의 확률을 낮춤). 개별 단어에서는 이상이 보이지 않지만, 충분히 긴 텍스트가 모이면 기계만이 인식할 수 있는 “암호”가 형성됩니다.

이미지와 파일의 경우에는 더 직접적입니다: 이미지에는 숫자 서명이 포함된 메타데이터가 추가되고, PDF/Word 등의 파일에는 숨겨진 출처 정보가 삽입됩니다. Anthropic은 이 워터마크가 “복사하여 붙여도 사라지지 않으며, 간단한 편집으로도 제거할 수 없다”고 주장했지만, 실제로는 쉽게 해독되었습니다.

2. GitHub의 해독 도구: AI 콘텐츠를 “깨끗이 청소”, 이미지와 파일 모두 제거

watermarks-remover의 강력한 기능은 모든 상황을 커버한다는 점입니다:

1. 텍스트 워터마크: 숨겨진 문자를 직접 삭제하거나, 다른 AI 모델을 사용하여 원문을 재작성함(원문의 어조와 문체가 손실될 수 있음);

2. 이미지 워터마크: CtrlRegen 도구를 사용하여 이미지를 재생성함(원본 내용은 유지하되, 픽셀을 새로 생성하여 워터마크를 완전히 제거함);

3. 파일 워터마크: PDF/Word의 EXIF/XMP 등 메타데이터를 삭제함(파일의 “신분증”을 제거하는 것과 같음);

4. 자가 검사 기능: 청화대학교의 검사 프레임워크를 사용하여 워터마크가 실제로 제거되었는지 확인함.

더욱 ironic한 것은, Claude 자체가 이 도구의 실행을 거부합니다: 사용자가 “내가 쓴 내용인데 워터마크만 제거하고 싶다”고 하더라도 허용하지 않습니다. 마치 “내가 추가한 것이니, 나는 제거할 수 없다”는 뜻입니다.

3. 왜 이런 전쟁이 일어났을까? 규제의 압박 + 회사의 발언권 잡기 + 사용자의 반발

이 전쟁은 우연이 아닙니다:

1. 규제 압력: 190개 이상의 AI 기업이 유럽 연합의 “AI 생성 콘텐츠 투명성 지침”에 서명했으며, AI 콘텐츠에는 기계가 인식할 수 있는 마크를 남겨야 합니다. Anthropic은 이에 가장 먼저 응답하여 “AI 보안”에 대한 발언권을 잡으려고 합니다;

2. 회사의 이기심: 누가 먼저 성숙한 워터마크 기술을 개발하느냐에 따라 향후 업계 규칙에서 우위를 차지할 수 있습니다(Antropic은 구글 DeepMind의 SynthID 기술을 사용하여 자사 기술력을 과시하려고 함);

3. 사용자의 반발: 워터마크가 “AI의 원죄”로 여겨집니다: 10시간 동안 자료를 조사하고 프레임워크를 구축한 뒤, Claude만 사용하여 몇 문장을 수정하는데도 다른 AI 생성 콘텐츠와 같은 워터마크가 붙으면 공정하지 않다고 생각합니다. 사용자들은 자신의 노동이 “AI로 생성됨”이라는 이유로 부정되는 것을 두려워합니다.

4. 사용자가 반발하는 핵심 이유: 워터마크가 “일률적인 라벨”이 되어 불공평하다!

사용자들은 “AI 콘텐츠에 마크를 남기는 것” 자체에 반대하는 것이 아니라, 워터마크의 부당함에 반발합니다:

  • 경계가 모호해짐: AI의 도움을 받아 작성된 콘텐츠(예: 수정, 자료 조사)와 전체가 AI로 생성된 콘텐츠가 워터마크로 인해 구분되지 않으며, “반AI” 콘텐츠가 “전AI” 콘텐츠로 간주됨;
  • 가치가 부정됨: 워터마크가 있는 콘텐츠는 플랫폼에서 제한을 받거나 독자에게 “내가 직접 쓴 것이 아니다”라는 의심을 받아 노동의 가치가 무시됨;
  • 선택권이 없음: Claude는 모든 사용자에게 워터마크를 강제로 추가하며, 사용자의 의사와 상관없이 적용됨(사용자들은 자신의 콘텐츠에 대한 통제권이 침해되었다고 느낍니다).

5. 이 공방전에 끝은 있을까? 더 스마트한 규칙이 필요함

워터마크와 해독 도구의 대결은 계속될 것입니다: Anthropic이 워터마크를 업그레이드하면 오픈소스 커뮤니티는 더 강력한 해독 도구를 개발할 것입니다. 하지만 근본적인 문제는 “AI를 인식하는 것”과 “창작자를 보호하는 것”의 균형을 맞추는 것입니다:

  • “등급별 마킹”이 가능할까요? 예: “AI의 도움을 받아 생성됨” 또는 “전체가 AI로 생성됨”으로 구분하는 것;
  • 사용자가 선택할 수 있을까요? 예: 유료 사용자는 워터마크를 비활성화할 수 있는지;
  • 규제가 더 유연해질 수 있을까요? 예: “고위험 AI 콘텐츠”(예: 뉴스, 광고)에만 워터마크를 요구하고, 일반 콘텐츠는 선택적으로 적용하는 것.

이런 순환에서 계속된다면 결국 피해를 보는 것은 일반 사용자입니다: AI 사기에 당하거나 자신의 작품이 오해를 받을 수 있습니다. 아마도 AI가 생성한 콘텐츠와 인간이 직접 만든 콘텐츠가 완전히 구별되지 않을 때까지 워터마크의 의미는 사라질 것입니다. 하지만 그날은 아직 멀었습니다.

이 전쟁은 본질적으로 AI 시대의 ‘정체성 인식’ 문제입니다: 우리는 AI가 사람을 속이는 것을 방지해야 하면서도, 사람들이 AI의 결과물을 인정받을 수 있도록 해야 합니다. 현재의 워터마크 기술은 아직 이 균형점을 찾지 못했습니다.