虎嗅

После производительности вычислительных мощностей на сцену выходят большие объемы текстовых данных: новый барьер в развитии искусственного интеллекта может изменить правила ценообразования в индустрии контента?

原文:算力之后是语料:AI的新瓶颈正在重塑内容产业的定价权?

Краткое содержание анализа

Статья посвящена проблеме нехватки качественных данных для больших AI-моделей: по мере увеличения размеров параметров моделей (от сотен миллиардов до триллионов) и их перехода на мультимодальные функции (рост спроса на изображения, видео и интерактивные данные) исчерпываются внутренние ресурсы Интернета. Кроме того, контент, генерируемый AI, загрязняет базу данных, увеличивая риск их деградации. В результате капитал стекается в секторы, занимающиеся производством данных для AI (например, компании Readker Culture и CITIC Publishing). Однако традиционным издательским компаниям предстоит преодолеть множество препятствий на пути перехода от продажи книг к продаже данных: сложности с авторскими правами, отсутствие стандартизированных систем ценообразования и конкуренция со стороны альтернативных решений. В заключение подчеркивается, что дефицит данных носит неоднородный характер (наиболее ценными являются специализированные, эксклюзивные и мультимодальные данные), а доходы издательских компаний от AI пока не стали реальностью; их долгосрочная конкурентоспособность зависит от способности к постоянному созданию нового контента и превращению данных в коммерческий актив.

Подробный анализ

1. Почему большие AI-модели испытывают нехватку качественных данных?

Большие AI-модели представляют собой своего рода “перерабатывающие заводы” для данных: вычислительная мощность играет роль печи, а данные — роли сырья. Однако качество данных важнее их количества. В отличие от вычислительной мощности (которая увеличивается по закону Мура каждые 18 месяцев), количество данных сокращается:

  • Экспоненциальный рост потребления: для обучения GPT-2 требовалось несколько десятков ГБ текста, для GPT-3 — несколько сотен ГБ; современные мультимодальные модели (способные понимать изображения, текст и интеракции) нуждаются в еще больших объемах данных. Например, для развития технологий бионического интеллекта требуется не менее 10 миллионов часов мультимодальных данных, однако в Китае доступно всего 500 тысяч часов таких данных, что составляет 99% дефицита.
  • Исчерпание источников: бесплатный контент с Интернета (блоги, форумы, книги) постепенно иссякает; к тому же контент, генерируемый AI, загрязняет базу данных для обучения следующих поколений моделей.

2. Последствия использования контента, генерируемого AI

Если использовать такой контент для обучения новых моделей, происходит ухудшение качества результатов: каждое новое поколение модели теряет часть информации (например, не может понимать редкие явления или выдавать ошибочные данные).

  • Способы смягчения проблемы: не все контенты, генерируемые AI, являются непригодными для использования; их можно фильтровать (удалять очевидно созданные AI-компоненты), смешивать с оригинальными данными и обрабатывать для устранения дубликатов.
  • Активные действия в Кремниевой долине: компания Anthropic сканировала книги по всему миру в поисках чистых оригинальных данных (проект “План Панамы”), но была обвинена в нарушении авторских прав и выплатила 1,5 миллиарда долларов. Это показывает, насколько ценны чистые оригинальные данные и как трудно их получить.

3. Переход издательских компаний к продаже данных

Ранее издательства зарабатывали на продаже книг, но теперь им необходимы качественные данные для AI-моделей. Однако цены на такие данные сильно различаются в зависимости от их назначения (обучение моделей или поиск информации). Например, HarperCollins сотрудничает с Microsoft: за лицензию на использование старых книг в течение трех лет взимается 5000 долларов (половина расходится между издательством и авторами), но это ограничивает возможности издательств.

  • Не все виды контента ценны: обычные романы и общедоступные древние книги (например, “Луньюй”) не представляют большой коммерческой ценности; ценность имеют только специализированные, эксклюзивные данные.
  • Ситуация в Китае: некоторые AI-компании уже покупают данные у издательств, но издательства должны сначала оцифровать и обработать эти данные, а также решить вопросы авторских прав (многие авторов старых книг недоступны для связи).

4. Альтернативные пути развития AI-технологий

AI-компании не ждут, пока издательства предоставят нужные данные, и используют другие подходы:

  • Создание синтетических данных: AI может генерировать качественные данные (например, математические задачи или код), которые могут заменять реальные.
  • Улучшение эффективности использования данных: совершенствование архитектуры моделей и методов обучения позволяет получать больше информации с меньшего количества данных.
  • Технологии типа RAG (Retrieval-Augmentation): модели не нуждаются в предварительном запоминании всей информации; они могут получать данные в реальном времени по запросу (например, спрашивая AI о ВВП на 2026 год).
  • Другие источники данных: покупка специализированных услуг у профессиональных компаний, использование общедоступных данных и прямые контакты с авторами.

5. Препятствия на пути издательских компаний к получению прибыли

Даже если издательства имеют авторские права, они не всегда могут установить контроль над ценообразованием:

  • Сложности с авторскими правами: издательства обладают только правом на публикацию, а авторы — правом на создание контента. Для использования данных в AI необходимо получать их разрешение от каждого автора; многие авторов старых книг недоступны для связи, что сужает возможности издательств.
  • Отсутствие стандартов ценообразования: нет единой системы для определения стоимости использования данных и распределения доходов между участниками. За рубежом принято покупать большие объемы данных за фиксированную сумму, но в Китае такие сделки еще не распространены.
  • Альтернативные источники данных: синтетические данные, услуги профессиональных компаний и открытые права на использование данных уменьшают влияние издательств.

Вывод: чтобы получать прибыль, издательства должны не только хранить старые книги, но и постоянно создавать новый качественный контент, превращая авторские права в коммерчески ценные данные. Кроме того, необходимо установить стабильные механизмы сотрудничества между AI-компаниями, издательствами и авторами.

Дополнение: причины роста цен на акции в секторе AI

Рост цен на акции компаний, занимающихся производством данных для AI, не связан с фактическим получением издательствами прибыли от продажи данных; это результат спекуляций на основе проблемы нехватки качественных данных. Системы управления авторскими правами, ценообразования и распределения доходов еще не сформированы, поэтому большая часть доходов издательств остается на стадии предварительных соглашений. В долгосрочной перспективе спрос на мультимодальные данные будет расти, а значение текстовых данных снизится; наибольшая ценность имеют специализированные, эксклюзивные и законно полученные мультимодальные данные, а также постоянная способность к созданию нового контента. Если талантливые авторы не смогут извлекать прибыль от сотрудничества с AI-компаниями, производство качественного контента замедлится, что повлияет на развитие всей индустрии. Для здорового развития необходим баланс интересов AI-компаний, издательств и авторов.