虎嗅

Después de la potencia de cálculo, llega el corpus de datos: ¿El nuevo cuello de botella del AI está remodelando el poder de fijación de precios en la industria del contenido?

原文:算力之后是语料:AI的新瓶颈正在重塑内容产业的定价权?

Resumen del contenido central

Este artículo se centra en la contradicción principal de la escasez de materiales de alta calidad para los grandes modelos de IA: a medida que el tamaño de los parámetros de los modelos de IA aumenta (de cientos de miles a billones) y evolucionan hacia múltiples modalidades (con un aumento en la demanda de datos gráficos, videos e interacción), los datos de alta calidad originales de Internet se están agotando gradualmente. Además, el contenido generado por IA puede contaminar el conjunto de datos, lo que conlleva el riesgo de un “colapso del modelo”. Por esta razón, el capital está invirtiendo en sectores relacionados con materiales de IA en la bolsa china (como Readker Culture y CITIC Publishing). Sin embargo, las editoriales tradicionales enfrentan numerosos obstáculos para transformarse de vendedoras de libros a proveedoras de datos, como problemas complejos de derechos de autor, la falta de sistemas de fijación de precios y la competencia de las alternativas basadas en IA. La conclusión final es que la escasez de materiales es selectiva (los datos profesionales, exclusivos y de múltiples modalidades son realmente los más escasos), y los ingresos de las editoriales provenientes de IA aún no se han concretado. Su competitividad a largo plazo dependerá de su capacidad para crear contenido continuamente y de la monetización de sus datos.

Análisis detallado

1. ¿Por qué los grandes modelos de IA necesitan “combustible”? – La crisis de escasez de materiales de alta calidad

Los grandes modelos de IA son como “fábricas de refinamiento de datos”: la potencia de cálculo es el horno y los datos son el mineral, pero la calidad del mineral es más importante que el tamaño del horno. Sin embargo, los datos no se comportan como la potencia de cálculo, que sigue la ley de Moore (se duplica cada 18 meses), mientras que los datos disminuyen con su uso:

  • Aumento en el consumo: El entrenamiento de GPT-2 requirió varios GB de texto, mientras que GPT-3 necesitó cientos de GB; los modelos multimodales actuales (capaces de comprender imágenes, texto e interacción con robots) demandan aún más datos. Por ejemplo, la inteligencia corpórea necesita al menos 10 millones de horas de datos multimodales, pero en China solo hay 500,000 horas de datos de interacción física legales, lo que representa una brecha del 99%.
  • Agotamiento de fuentes: Los contenidos humanos originales y gratuitos en Internet (como blogs, foros y libros) se están agotando rápidamente. Peor aún, el contenido generado por IA (como artículos escritos por IA) se mezcla con los datos, contaminando los materiales de entrenamiento de las siguientes generaciones de modelos.

En resumen, la velocidad a la que la IA consume datos es mucho mayor que la velocidad a la que los humanos producen datos de alta calidad.

2. El “búmeran” del contenido generado por IA: el problema de contaminar sus propios datos

¿Qué pasa si se utiliza contenido escrito por IA para entrenar otros modelos de IA? Es como copiar copias una y otra vez: cada nueva generación pierde información, lo que hace que los modelos se vuelvan menos eficaces (por ejemplo, no entienden eventos raros o generan contenido incorrecto). Esto se denomina “colapso del modelo”.

  • Soluciones: No todo el contenido generado por IA es inutil; se puede mitigar este problema filtrando rigurosamente el contenido (eliminando lo que claramente fue generado por IA), mezclándolo con datos humanos originales y limpiando los datos duplicados.

3. Las editoriales tradicionales se convierten en “mineros de IA”: la transformación de vendedoras de libros a proveedoras de datos

Antes, las editoriales ganaban dinero vendiendo libros; ahora, las empresas de IA necesitan datos de alta calidad. Las editoriales pueden extraer y vender estos derechos a las empresas de IA. Sin embargo, hay varios factores importantes a considerar:

  • Diferencias significativas en los precios: Los datos utilizados por IA tienen precios muy diferentes según su finalidad (entrenamiento de modelos o búsqueda rápida de información); no todos los derechos de autor pueden venderse a un precio alto. Por ejemplo, la colaboración entre HarperCollins y Microsoft implica una tarifa de licencia de 5000 dólares por libro antiguo cada tres años, dividida equitativamente entre el autor y la editorial, solo para fines de entrenamiento.
  • No todos los contenidos son valiosos: Los novelas comunes y los textos clásicos de dominio público (como los Analectos de Confucio) son abundantes y no tienen mucho valor; en cambio, los contenidos especializados, exclusivos o de nicho (como manuales médicos, casos legales e informes detallados del sector) son escasos y por lo tanto más valiosos.
  • Situación en China: Ya hay empresas de IA comprando datos a editoriales, pero estas deben primero digitalizar, limpiar y etiquetar los datos, además de resolver problemas relacionados con los derechos de autor (muchos autores de libros antiguos no están disponibles).

4. Las alternativas de las empresas de IA para no depender de los libros

Las empresas de IA no esperan a que las editoriales proporcionen los datos necesarios; tienen otras opciones:

  • Datos sintéticos: Los modelos de IA pueden generar sus propios datos de alta calidad (por ejemplo, problemas matemáticos o código), lo que puede reemplazar parte de los datos reales.
  • Mejora en la eficiencia del uso de datos: Mejorando la arquitectura de los modelos y los métodos de entrenamiento, se puede utilizar menos datos para obtener más información.
  • Técnicas como RAG (Retrieval with Augmentation): Los modelos no necesitan recordar todo el conocimiento durante el entrenamiento previo; pueden buscar información en tiempo real cuando sea necesario (por ejemplo, preguntarle a un modelo de IA sobre el PIB de 2026 y él buscará la información directamente en una base de datos).
  • Otras fuentes: Comprar datos de proveedores especializados, utilizar datos públicos y legales, o contactar directamente con los autores para evitar a las editoriales.

Por lo tanto, los derechos de autor de libros tradicionales son solo una de las muchas fuentes de datos disponibles para las empresas de IA; no son un requisito esencial.

5. De los derechos de autor al poder de fijación de precios: tres barreras que impiden que las editoriales ganen dinero

Incluso si las editoriales poseen derechos de autor, no siempre pueden determinar los precios debido a tres obstáculos principales:

  • Confusión en la propiedad de los derechos: Las editoriales solo tienen el derecho de publicación; los derechos de autor del texto pertenecen a los autores. Para autorizar el uso de los datos para entrenar modelos, deben negociar con cada autor individualmente. Muchos autores de libros antiguos no están disponibles y los contratos no incluyen cláusulas sobre la autorización de IA, lo que reduce las posibilidades de acuerdo.
  • Sistemas de fijación de precios inmaduros: No hay reglas uniformes para determinar cuántos datos ha utilizado la IA, cómo evitar el uso ilegal de los datos o cómo repartir los ingresos con los autores. Actualmente, en el extranjero se compran conjuntos completos de datos, pero las transacciones basadas en el número de caracteres aún no están generalizadas.
  • Alternativas a los datos proporcionados por IA: Los datos sintéticos, los proveedores especializados y los datos open source diluyen la capacidad de las editoriales para negociar precios. Además, los libros de dominio público (como los textos clásicos) son gratuitos, lo que reduce el precio de los libros comunes.

Conclusión: Para obtener poder de fijación de precios, las editoriales deben seguir produciendo contenido original de alta calidad y convertir sus derechos de autor en activos digitales que sean legales, rastreables y comerciables. También necesitan establecer mecanismos de distribución de beneficios estables entre empresas de IA, editoriales y autores. Solo contar con textos existentes no es suficiente para sobrevivir en la era de la IA.

Adición final: La verdadera razón del aumento repentino en los precios de las acciones relacionadas con materiales de IA

El aumento en los precios de las acciones relacionados con materiales de IA en agosto no se debió a que las editoriales realmente hayan ganado dinero de las empresas de IA, sino a la especulación sobre la escasez de estos materiales. Actualmente, los sistemas de verificación de derechos, fijación de precios y distribución de beneficios aún no están maduros, y la mayoría de los ingresos de las editoriales relacionados con IA se encuentran en la fase de acuerdos preliminares. A largo plazo, la demanda de datos multimodales (gráficos, videos e interacción) seguirá aumentando, mientras que el valor de los datos de texto puramente textual disminuirá. Lo realmente escaso son los datos profesionales, exclusivos y legales, así como la capacidad humana para crear contenido original continuamente. Si los creadores principales no pueden beneficiarse de las licencias de IA, la motivación para producir contenido de alta calidad se reducirá, lo que afectará negativamente al desarrollo del sector en su conjunto. Por lo tanto, el desarrollo saludable de este sector requiere un equilibrio entre empresas de IA, editoriales y autores.