虎嗅

Nach der Rechenleistung kommt nun das Korpus – Ist das neue Engpass des AI-Technologiesystems dabei, die Preisgestaltungsmacht in der Content-Industrie umzukrempeln?

原文:算力之后是语料:AI的新瓶颈正在重塑内容产业的定价权?

Zusammenfassung des Kerninhalts

Diese Nachricht konzentriert sich auf das zentrale Dilemma der „Knappheit an hochwertigem Material für große AI-Modelle“: Mit der Erweiterung der Parametergröße von AI-Modellen (von Hunderten von Milliarden auf Billionen) und ihrer Entwicklung hin zu multimodalen Anwendungen (steigender Bedarf an Bildern, Videos und interaktiven Daten) werden die hochwertigen Daten aus dem Internet allmählich erschöpft. Zudem verschmutzen künstlich erzeugte Inhalte den Datenspeicher, was das Risiko eines „Modellkollapses“ erhöht. Kapital fließt daher in den AI-Datensektor an der A-Sekunde-Börse (wie Readker Culture, CITIC Publishing), doch traditionelle Content-Anbieter (Verlage) stehen vor zahlreichen Herausforderungen bei der Umstellung von der Buchverkauf auf den Verkauf von Daten – unter anderem aufgrund komplizierter Urheberrechte, fehlender Preisgestaltungsmechanismen und alternativer Ansätze zur Datenbeschaffung. Die Schlussfolgerung ist, dass die Knappheit an Material vor allem bei spezialisierten, exklusiven und multimodalen Daten besteht. Die AI-Einnahmen der Verlage haben sich bisher noch nicht realisiert; ihre langfristige Wettbewerbsfähigkeit hängt von ihrer kontinuierlichen Kreativität und der Verwertung ihrer Daten ab.

Detaillierte Analyse

1. Warum klagen große AI-Modelle über einen Mangel an „Kraftstoff“? – Die Krise der Knappheit an hochwertigem Material

Große AI-Modelle sind wie „Data-Raffinerien“: Rechenleistung ist das „Feuer“, Daten das „Erz“. Die Qualität des Erzes ist wichtiger als die Größe des Feuers. Allerdings unterscheiden sich Daten und Rechenleistung grundlegend: Während sich die Rechenleistung alle 18 Monate verdoppelt (Moores-Gesetz), nehmen die Datenmenge mit der Nutzung ab:

  • Explosiver Verbrauch: Die Trainingsdaten für GPT-2 umfassten einige GB, GPT-3 benötigte bereits mehrere hundert GB; moderne multimodale Modelle (die Bilder, Texte und Roboterinteraktionen verstehen können) verlangen noch größere Datenmengen. Beispielsweise benötigt ein Körperbewusstes AI-Modell mindestens 10 Millionen Stunden an multimodalen Daten – in China gibt es jedoch nur 500.000 Stunden an zugelassenen physischen Interaktionsdaten, was einem Mangel von 99 % entspricht.
  • Erschöpfung der Quellen: Die kostenlosen, natürlichen Inhalte aus dem Internet (Blogs, Foren, Bücher) werden allmählich erschöpft; schlimmer noch: Künstlich erzeugte Inhalte verschmutzen die Trainingsdaten für zukünftige Modelle.

Kurz gesagt: AI verbraucht Daten viel schneller, als Menschen hochwertige Daten produzieren können.

2. Die „Bumerang-Wirkung“ künstlich erzeugter Inhalte – Der selbstverursachte Schaden

Was passiert, wenn mit von AI geschriebenen Artikeln weitere AI-Modelle trainiert werden? Es ist wie das Kopieren von Kopien: Jede Generation verliert an Qualität; die Modelle werden immer unzureichend (z. B. verstehen seltene Ereignisse nicht oder liefern falsche Informationen – ein Phänomen, das als „Modellkollaps“ bezeichnet wird).

  • Lösungen: Nicht alle AI-Inhalte sind schädlich; durch strenge Filterung (Entfernung offensichtlich künstlich erzeugter Inhalte), Mischung mit natürlichen Daten und Bereinigung können die Degeneration eingedämmt werden.
  • Verrückte Maßnahmen in Silicon Valley: Um saubere Originale zu erhalten, scannte Anthropic heimlich Bücher weltweit („Project Panama“); es kam zu einer Klage wegen des Herunterladens von 7 Millionen Büchern aus Piratendatenbanken – die größte Urheberrechtsvereinbarung in der Geschichte der USA. Dies zeigt, wie wertvoll und schwer zugänglich saubere Originale sind.

3. Traditionelle Verlage werden zu „AI-Bergleuten“ – Der Wandel vom Buchverkauf zum Dataverkauf

Früher verdienten Verlage mit dem Buchverkauf Geld; heute benötigen AI-Unternehmen hochwertige Daten. Verlage können urheberrechtlich geschützte Inhalte an AI-Unternehmen verkaufen – doch es gibt mehrere Herausforderungen:

  • Großer Preisunterschied: Die Preise für Daten variieren stark je nach Verwendungszweck (z. B. Modelltraining vs. Datenabruf); nicht alle Urheberrechte lassen sich zu hohen Preisen verkaufen. Beispielsweise kostet die Lizenz für alte Bücher bei HarperCollins und Microsoft 5000 US-Dollar pro Buch pro drei Jahre (geteilt zwischen Autor und Verlag, ausschließlich für das Training).
  • Nicht alle Inhalte sind wertvoll: Alltägliche Romane oder öffentlich zugängliche Klassiker (z. B. „Die Analecten“) sind weit verbreitet und daher billig; nur spezialisierte, exklusive oder branchenspezifische Inhalte (z. B. medizinische Lehrbücher, Rechtsurteile, detaillierte Berichte) sind knapp und teuer.
  • Situation in China: AI-Unternehmen kaufen bereits Daten von Verlagen – diese müssen die Daten jedoch digitalisieren, bereinigen und annotieren sowie Autorlizenzen einholen (viele Autoren älterer Bücher sind nicht mehr erreichbar).

4. Alternativen für AI-Unternehmen – Wege ohne den Kauf von Büchern

AI-Unternehmen warten nicht darauf, dass Verlage Daten liefern; sie haben eigene Lösungen:

  • Synthese von Daten: AI erzeugt selbst hochwertige Daten (z. B. Mathematikaufgaben, Code), die teilweise echte Daten ersetzen können (in manchen Bereichen sogar besser als diese).
  • Verbesserung der Datennutzungseffizienz: Verbesserte Modelle (z. B. MoE) und Trainingsmethoden ermöglichen es, mit weniger Daten mehr zu lernen.
  • RAG-Technologie: Modelle müssen nicht alle Informationen beim Vortraining speichern; sie können bei Bedarf direkt in Datenbanken nachschlagen (z. B. „Welche war die GDP im Jahr 2026?“).
  • Andere Quellen: Kauf von Daten von Fachdienstleistern, Nutzung öffentlicher Daten, direkte Absprachen mit Autoren, Nutzung internationaler Mehrsprachendaten.

Daher sind Verlagsurheberrechte nur eine der vielen Datenquellen – kein Muss für AI-Unternehmen.

5. Vom Urheberrecht zum Preisgestaltungsrecht – Drei Barrieren hindern Verlage am Gewinn

Auch wenn Verlage über Urheberrechte verfügen, bedeutet das nicht automatisch, dass sie das Preisrecht haben:

  • Unklare Rechtsverhältnisse: Verlage besitzen nur das „Veröffentlichungsrecht“; die Autoren behalten die Urheberrechte. Um Daten für AI zu nutzen, müssen sie mit jedem Autor einzeln verhandeln – viele Autoren sind nicht mehr erreichbar, und Verträge enthalten oft keine entsprechenden Klauseln.
  • Unzureife Preisgestaltungsmechanismen: Es gibt keine einheitlichen Regeln dafür, wie viel Daten genutzt werden oder wie die Kosten verteilt werden sollen. Weltweit wird meist „die gesamte Datenbank“ gekauft; präzise Abrechnungen nach Anzahl der Wörter sind noch nicht üblich.
  • Alternativen zu AI: Künstlich erzeugte Daten, professionelle Dienstleister, Open-Source-Daten, direkte Absprachen mit Autoren – all diese Optionen verringern die Verhandlungsmacht der Verlage. Zudem drücken kostenlose öffentliche Bücher (z. B. alte Schriften) den Preis von regulären Büchern.

Fazit: Um ein Preisrecht zu erlangen, müssen Verlage kontinuierlich hochwertige Originalinhalte produzieren und ihre Urheberrechte in „reguläre, nachvollziehbare und handelbare“ Daten verwandeln. Sie benötigen außerdem stabile Abkommen zwischen AI-Unternehmen, Verlagen und Autoren. Allein auf Bestände angewiesene Texte reichen im Zeitalter von AI nicht aus.

Zusatz: Die Wahrheit hinter dem Anstieg an der A-Sekunde-Börse

Der kollektive Anstieg des AI-Datensektors im August war nicht darauf zurückzuführen, dass Verlage tatsächlich Geld mit AI verdient haben – es handelte sich um eine Spekulation auf die Knappheit an hochwertigem Material. Derzeit sind Rechte, Preisgestaltungsmechanismen und Abrechnungssysteme noch nicht ausgereift; die AI-Einnahmen der Verlage befinden sich meist noch in der Planungsphase. Langfristig wird der Bedarf an multimodalen Daten (Bilder, Videos, Interaktionen) weiter steigen, während der Wert reiner Textdaten abnehmen wird. Die wahren Knappheiten liegen in spezialisierten, exklusiven und regulären Daten sowie in der kontinuierlichen menschlichen Kreativität.

Falls erstklassige Kreative nicht von AI-Lizenzen profitieren können, wird die Motivation zur Produktion hochwertiger Inhalte nachlassen – letztendlich könnte auch die Entwicklung der AI ins Stocken geraten. Daher ist eine gesunde Entwicklung dieser Branche nur möglich, wenn Interessen von AI-Unternehmen, Verlagen und Autoren ausgeglichen werden.