虎嗅

**계산 능력에 이어 언어 데이터가 등장하다: AI의 새로운 병목 현상이 콘텐츠 산업의 가격 결정권을 재편하고 있는가?**

原文:算力之后是语料:AI的新瓶颈正在重塑内容产业的定价权?

핵심 내용 요약

이 기사는 “AI 대형 모델의 고품질 언어 자료 부족”이라는 핵심 문제를 중심으로 다룹니다. AI 모델의 파라미터 규모가 확장되고(수천억에서 수조 단위로), 다중 모달 기능으로 발전함에 따라 인터넷상의 고품질 데이터가 점차 고갈되고 있으며, AI가 생성하는 콘텐츠가 데이터 풀을 오염시켜 “모델 붕괴” 위험이 발생하고 있습니다. 이에 자본은 A주 시장의 AI 언어 자료 관련 업체(예: 독객문화, 중신출판)에 투자하고 있지만, 전통적인 콘텐츠 제공업체(출판사)는 “책 판매”에서 “데이터 판매”로의 전환을 시도하는 데 저작권 문제, 가격 책정 체계의 부재, AI에 의한 대체 가능성 등 여러 장애물에 직면하고 있습니다. 결론적으로 언어 자료의 부족은 계층화되어 있으며(전문/독점/다중 모달 데이터가 실제로 부족함), 출판사의 AI 수익은 아직 확정되지 않았으며, 장기적인 경쟁력은 지속적인 창작 능력과 데이터 자산화 능력에 달려 있습니다.

상세한 분석

1. AI 대형 모델이 “연료 부족”을 호소하는 이유는? – 고품질 언어 자료의 위기

AI 대형 모델은 “데이터 정제 공장”과 같으며, 연산 능력은 가열로, 데이터는 원석에 해당합니다. 그러나 데이터와 연산 능력은 다릅니다: 연산 능력은 무어의 법칙(18개월마다 성능이 두 배로 증가)을 따르지만, 데이터는 사용할수록 줄어듭니다:

  • 사용량 폭발: GPT-2는 수십 GB의 텍스트를 사용하여 훈련했지만, GPT-3은 수백 GB가 필요합니다. 현재 다중 모달 모델(이미지/텍스트/로봇 상호작용을 이해하는 AI)은 더 많은 데이터가 필요하며, 신체 기반의 지능을 위해서는 최소 1000만 시간 분량의 다중 모달 데이터가 필요하지만, 국내에서는 합법적인 물리적 상호작용 데이터가 50만 시간에 불과하여 99%의 격차가 있습니다.
  • 출처 고갈: 인터넷상의 무료 원본 인간 콘텐츠(블로그, 포럼, 책 등)는 거의 고갈되었습니다. 더 심각한 것은 AI가 생성하는 콘텐츠(예: AI가 작성한 기사)가 데이터 풀에 섞여 다음 세대 모델의 학습 자료를 오염시킨다는 점입니다.

간단히 말해, AI가 데이터를 소비하는 속도는 인간이 고품질 데이터를 생산하는 속도보다 훨씬 빠릅니다.

2. AI가 생성하는 콘텐츠의 “부메랑 효과” – 스스로를 오염시키는 문제

AI가 작성한 기사를 다시 사용하여 AI를 훈련하면 어떻게 될까요? 이는 “복사본을 복사하는 것”과 같아서, 각 세대마다 정보가 손실되어 모델이 점점 더 약해집니다(예: 희귀 사건을 이해하지 못하거나 잘못된 콘텐츠를 출력함).

  • 완화 방법: 모든 AI 콘텐츠가 문제가 되는 것은 아닙니다. 명확하게 AI가 생성한 부분을 걸러내고, 인간이 작성한 원본 데이터와 혼합하며, 중복된 데이터를 제거함으로써 퇴화를 억제할 수 있습니다.
  • 실리콘밸리의 노력: 깨끗한 원본 데이터를 찾기 위해 Anthropic은 전 세계의 책을 비밀리에 스캔했으며(“파나마 프로젝트”라는 코드명), 불법 복사본에서 700만 권의 책을 다운로드하여 15억 달러의 손해를 배상했습니다(미국 저작권 역사상 가장 큰 합의 사례). 이는 깨끗한 원본 데이터가 얼마나 귀중하고 구하기 어려운지를 보여줍니다.

3. 전통 출판사의 변화 – “책 판매”에서 “데이터 판매”로의 전환

이전에는 출판사가 책을 판매하여 수익을 올렸지만, 이제 AI 회사들은 고품질 데이터가 필요합니다. 출판사는 저작권이 있는 콘텐츠를 AI에게 판매할 수 있습니다. 그러나 여기에는 몇 가지 중요한 문제가 있습니다:

  • 용도에 따른 가격 차이: AI가 데이터를 구입하는 데에는 “모델 훈련”(비싼 가격)과 “정보 검색”(저렴한 가격)이라는 두 가지 목적이 있으며, 모든 저작권을 고가로 판매할 수 있는 것은 아닙니다. 예를 들어, 하퍼콜린스와 마이크로소프트는 오래된 책 한 권당 3년 동안 5000달러의 사용권을 제공하지만(저자와 출판사가 각각 절반씩 나눔), 이는 모델 훈련에만 사용됩니다.
  • 모든 콘텐츠가 가치 있는 것은 아닙니다: 일반 소설이나 공개된 고전(예: 논어)은 공급이 많아 가치가 없지만, 전문/독점적인 콘텐츠(의학 교재, 법률 사례, 업계 심층 보고서 등)는 부족하여 고가로 판매됩니다.
  • 국내 상황: 이미 AI 회사들이 출판사로부터 데이터를 구입하고 있지만, 출판사는 먼저 데이터를 디지털화하고 정제하며, 저자의 사용권 문제(많은 오래된 책의 저자와 연락이 닿지 않음)를 해결해야 합니다.

4. AI 회사의 대체 전략 – 책을 사지 않고도 생존할 수 있는 방법

AI 회사들은 출판사가 데이터를 제공하기를 기다리지 않습니다. 그들은 자신만의 대안을 가지고 있습니다:

  • 합성 데이터: AI가 직접 고품질 데이터(예: 수학 문제, 코드)를 생성하여 실제 데이터의 일부를 대체할 수 있습니다(예: 수학 분야에서는 합성 데이터가 실제 데이터보다 더 좋은 결과를 낼 수 있음).
  • 데이터 효율성 향상: 모델 아키텍처를 개선하거나(예: MoE를 사용하여 필요한 부분만 활성화) 훈련 방법을 최적화함으로써 더 적은 데이터로 더 많은 것을 학습할 수 있습니다.
  • RAG 기술: 모델이 사전 훈련 시 모든 지식을 기억할 필요가 없으며, 필요할 때마다 실시간으로 정보를 검색할 수 있습니다(예: AI에게 “2026년 GDP”를 물으면 데이터베이스에서 직접 검색함).
  • 기타 출처: 전문 데이터 서비스 제공업체(예: 해천서성)로부터 데이터를 구입하거나, 공개된 합법적인 데이터를 활용하거나, 저자와 직접 계약을 맺거나(출판사를 우회하여), 해외의 다양한 언어 데이터를 사용합니다.

따라서 전통적인 도서 저작권은 데이터 소스 중 하나에 불과하며, AI 회사에게 필수적인 것은 아닙니다.

5. 저작권에서 가격 책정 권한까지 – 출판사가 수익을 올리는 데 장애물

출판사가 저작권을 가지고 있더라도 가격 책정 권한을 얻기는 어렵습니다. 세 가지 주요 장애물이 있습니다:

  • 저작권 소유권의 혼란: 출판사는 “출판권”만 가지고 있으며, 텍스트의 저작권은 저자에게 있습니다. AI 훈련을 위해 저자와 개별적으로 계약을 맺어야 하지만, 많은 오래된 책의 저자와 연락이 닿지 않거나 계약서에 AI 사용권 조항이 없어 성공하는 경우가 드물습니다.
  • 가격 책정 체계의 미비: AI가 얼마나 많은 데이터를 사용했는지, 데이터가 도용되는 것을 방지하는 방법, 저자에게 얼마를 지불할지에 대한 명확한 규칙이 없습니다. 현재 해외에서는 대부분 “전체 데이터베이스를 일괄 구매”하는 방식을 사용하지만, 문자 단위로 가격을 책정하는 정밀한 거래는 아직 이루어지지 않았습니다.
  • AI의 대체 가능성: 합성 데이터, 전문 서비스 제공업체, 오픈 소스 데이터, 저자와의 직접 계약 등이 출판사의 협상력을 약화시킵니다. 또한 공개된 책(예: 고전)은 무료로 제공되어 일반 도서의 가격을 낮춥니다.

결론: 출판사가 가격 책정 권한을 얻으려면 단순히 오래된 책을 보유하는 것만으로는 부족합니다. 지속적으로 고품질의 독창적인 콘텐츠를 생산하고, 저작권을 “합법적이고 추적 가능하며 거래 가능한” 데이터 자산으로 전환해야 합니다. 또한 AI 회사, 출판사, 저자 간의 안정적인 수익 분배 메커니즘을 구축해야 합니다. 단순히 기존의 텍스트만으로는 AI 시대에 경쟁력을 유지할 수 없습니다.

추가 정보: A주 시장의 급등 원인

8월에 AI 언어 자료 관련 업체들이 일제히 상승한 것은 출판사가 실제로 AI에서 수익을 올렸기 때문이 아니라, “언어 자료 부족”이라는 새로운 시나리오에 대한 자본의 투자 때문입니다. 현재 저작권 확정, 가격 책정, 수익 분배 체계가 모두 미비하여 출판사의 AI 수익은 대부분 “의향 계약” 단계에 머물러 있습니다. 장기적으로는 다중 모달 데이터(이미지/텍스트/로봇 상호작용)의 수요가 증가할 것이며, 순수 텍스트 기반의 언어 자료의 중요성은 점차 줄어들 것입니다. 진정으로 부족한 것은 전문적이고 독점적이며 합법적인 다중 모달 데이터와 지속적인 인간의 창작 능력입니다.

만약 일선 창작자들이 AI 저작권에서 이익을 얻지 못한다면, 고품질 콘텐츠의 생산 동기가 감소할 것이며, 결국 AI도 제대로 작동하지 않게 될 것입니다. 따라서 이 업계의 건강한 발전을 위해서는 AI 회사, 출판사, 저자 간의 이해관계를 조정하는 것이 필요합니다.

결론

출판사가 경쟁력을 유지하려면 단순히 오래된 책을 보유하는 것만으로는 부족합니다. 지속적으로 고품질의 독창적인 콘텐츠를 생산하고, 저작권을 “합법적이고 추적 가능하며 거래 가능한” 데이터 자산으로 전환해야 합니다. 또한 AI 회사, 출판사, 저자 간의 안정적인 수익 분배 메커니즘을 구축해야 합니다.