虎嗅

**실리콘밸리 기업들, AI 관련 불필요한 데이터(‘쓰레기’) 정리에 나서다** 실리콘밸리의 주요 기업들이 인공지능(AI) 분야에서 생성된 불필요하거나 오류가 있는 데이터를 청소하는 작업을 시작했습니다. 이는 AI 기술의 정확성과 효율성을 높이기 위한 중요한 조치입니다. 최근 연구에 따르면, AI 모델의 성능은 사용되는 데이터의 질에 크게 영향을 받으며, 정제되지 않은 데이터는 모델의 오류를 유발할 수 있습니다. 따라서 기업들은 AI 개발 과정에서 데이터의 청결성을 더욱 중시하고 있습니다. 이러한 데이터 정리 작업은 AI 산업 전반에 긍정적인 영향을 미칠 것으로 예상됩니다. 데이터의 질이 향상되면 AI 모델의 예측 능력과 의사결정 능력도 더욱 정확해지고, 이는 새로운 제품과 서비스의 개발을 촉진할 것입니다. 또한, 데이터 청소 작업은 AI 기술의 신뢰성을 높여 소비자와 기업 모두에게 더 많은 이점을 제공할 것입니다. 실리콘밸리 기업들의 이러한 노력은 AI 산업이 보다 건강하고

原文:硅谷公司开始清理AI垃圾

핵심 내용 요약

AI가 생성한 “무의미한 콘텐츠”(예: 의미 없는 레시피, 가짜 전기, 이상한 이미지 및 영상)가 구글, 아마존, 페이스북 등 주요 플랫폼에서 넘쳐나 온라인 정보 환경을 오염시키고 있습니다. 이제 실리콘밸리의 기술 회사들(스포티파이, 유튜브, 링크드인 등)이 대대적으로 이러한 쓰레기 콘텐츠를 정리하기 시작했지만, 많은 어려움에 직면하고 있습니다. 이 회사들 중 상당수는 과거 AI 도구의 확산을 주도한 “원인 제공자”였기 때문에, 합법적인 크리에이터를 오해로 삭제할 위험이 있으며, 쓰레기 콘텐츠의 정의와 관리 자체가 복잡한 시스템적 문제로 단순히 삭제하는 것만으로는 해결되지 않습니다.

1. AI 쓰레기 콘텐츠가 얼마나 만연해 있을까?

구글에서 레시피를 검색하면 “접착제 피자”와 같은 이상한 결과가 나오고, 아마존에서 판매되는 전기는 AI가 작성한 가짜 콘텐츠일 수 있으며, 페이스북에서는 “새우 요슈아”와 같은 의미 없는 이미지를 보게 됩니다. 구체적인 데이터는 더욱 충격적입니다:

  • 스포티파이는 지난해 7,500만 개의 쓰레기 곡(대량 업로드, 중복 곡)을 삭제했으며, 이는 음악 라이브러리의 상당 부분을 차지합니다;
  • 유튜브는 반년 동안 13만 개의 저품질 AI 채널을 정리했습니다;
  • 디저(Deezer)에서 매일 업로드되는 곡의 거의 절반이 AI가 생성한 것이며, 많은 곡은 아무도 듣지 않습니다;
  • 애플 뮤직에서 업로드된 콘텐츠의 3분의 1이 AI가 만들었습니다;
  • X(구 트위터)에서는 50자 이상의 게시물의 거의 절반이 AI가 작성했습니다.

심지어 사전 회사인 메리엄-웹스터(Merriam-Webster)도 “AI 쓰레기”를 2025년의 단어로 선정할 정도로 문제가 심각합니다.

2. 왜 지금에서야 실리콘밸리가 조치를 취하는가?

이전에는 AI 콘텐츠가 사용자의 클릭을 늘려준다고 생각했지만, 상황이 변했습니다:

  • 사용자들의 불만이 커지고 있습니다: 저품질의 제목만 보여주는 콘텐츠가 많아 진정으로 원하는 정보를 찾을 수 없으며, 메타(Meta)가 출시한 AI 기반 비디오 플레이리스트는 “쓰레기 전시대”라고 비난받습니다;
  • 플랫폼의 부담이 증가했습니다: 쓰레기 콘텐츠가 많아 고품질 콘텐츠의 공간을 차지하고 있으며, 예를 들어 유튜브의 신규 사용자 추천 영상 중 20%가 AI 쓰레기입니다. 일부 쓰레기 채널은 연간 425만 달러를 벌지만, 플랫폼은 결국 수익 창출 자격을 중단해야 했습니다;
  • 여론의 변화가 있습니다: 전문가들은 쓰레기를 방치하면 “인간의 창의성을 억압하고 문화를 부패시킬” 것이라고 하며, 사용자들은 “온라인에서 무엇이 진짜인지 구별할 수 없다”고 불평합니다. 플랫폼이 계속 방치하면 사용자를 잃게 될 것입니다.

3. 플랫폼들은 어떤 방법으로 쓰레기를 정리하고 있을까?

콘텐츠 삭제, 사용자 신고, AI 기반의 대응, 그리고 사용자 스스로의 조정 등 다양한 방법을 사용합니다:

  • 직접 삭제: 스포티파이는 중복 곡을 삭제하고, 유튜브는 저품질 채널을 삭제했으며, 틱톡은 올해 첫 3개월 동안 37.7만 개의 위반 AI 영상을 삭제했습니다;
  • 사용자 참여: 링크드인은 AI 쓰레기 신고 버튼을 추가했으며, 핀터레스트와 틱톡은 사용자가 “AI 콘텐츠를 줄이도록” 설정할 수 있게 했습니다;
  • AI 기반 대응: 유튜브는 AI를 사용해 업로드 속도와 반복적인 템플릿을 분석하여 쓰레기 계정을 찾고, 서브스택(Substack)은 AI 도구를 사용해 긴 게시물이 AI가 작성한 것인지 확인합니다;
  • 수익 제한: X는 로봇이 쓰레기 콘텐츠를 업로드하도록 허용하는 앱을 차단했으며, 유튜브는 쓰레기 채널의 수익 창출 자격을 중단했습니다.

4. 정리가 그렇게 간단하지 않다: 합법적인 크리에이터를 오해로 삭제할 수 있으며, 정의가 모호하고, 플랫폼 자체의 “이중 잣대”가 존재합니다

정리 과정에서 많은 문제가 발생합니다:

  • 합법적인 크리에이터를 오해로 삭제: 유튜브는 “업로드 속도가 빠르고 템플릿이 반복된다”는 기준으로 쓰레기를 판단하여 고품질 콘텐츠를 대량으로 업로드하는 크리에이터를 삭제할 수 있습니다; 서브스택의 AI 검출 도구는 인간이 작성한 게시물을 AI가 작성한 것으로 오인하여 작성자가 자신의 무죄를 증명해야 합니다;
  • 정의의 모호성: AI 콘텐츠가 전부 쓰레기는 아닙니다. 예를 들어, AI를 사용해 글을 작성하는 것도 쓰레기로 간주될 수 있나요? 플랫폼은 이를 명확히 구분하기 어렵습니다;
  • 플랫폼의 이중 잣대: 많은 플랫폼이 쓰레기를 정리하면서도 과거에 AI 도구를 확산시켜 문제를 악화시켰습니다. 예를 들어, 메타는 AI 쓰레기를 관리하겠다고 하면서도 이미지 생성기를 출시하여 사용자 데이터를 남용했으며, 사용자의 반대로 기능을 삭제해야 했습니다.

5. 전문가의 경고: 이는 시스템적인 문제로 단순히 쓰레기를 삭제하는 것만으로 해결되지 않습니다

컬럼비아 대학교의 전문가는 AI 쓰레기가 “단순한 나쁜 콘텐츠”가 아니라 정보 환경 전체의 시스템적 문제라고 말합니다:

  • AI는 양날의 검입니다: 플랫폼은 사용자 참여도를 높이기 위해 AI를 사용하지만, 생성된 쓰레기로 인해 부담을 받습니다;
  • 단순히 “일괄적으로 처리”할 수 없습니다: AI는 창의성 도구이며, 합법적인 AI 기반의 창작 활동은 오해로 삭제되어서는 안 됩니다;
  • 플랫폼이 잘 처리하지 못하면 사용자를 잃게 됩니다: 사용자가 고품질 콘텐츠를 찾지 못하면 다른 플랫폼으로 이동할 것입니다.

간단히 말해, AI 쓰레기를 정리하는 것은 단순한 “쓰레기 청소”가 아니라 플랫폼의 인센티브 메커니즘(예: 클릭 수만 보지 않는 것)을 근본적으로 해결해야 합니다. AI가 편리함을 제공하는 동시에 새로운 문제를 만들었으며, 이제 플랫폼들이 이를 인식하기 시작했지만 아직 갈 길이 멉니다. 일반 사용자도 온라인에서 더 주의를 기울여 저품질의 AI 콘텐츠에 속지 않도록 해야 합니다.