Résumé du contenu principal
Ce rapport de presse se concentre sur le conflit majeur lié à la pénurie de données de haute qualité pour les grands modèles d'IA : à mesure que l'échelle des paramètres des modèles d'IA augmente (de centaines de milliards à des billions) et qu'ils évoluent vers une approche multimodale (augmentation de la demande en données graphiques, vidéo et interactives), les données de haute qualité issues d'Internet se raréfient progressivement. De plus, le contenu généré par l'IA peut contaminer la base de données, créant un risque de « colaps du modèle ». En conséquence, le capital se dirige vers les secteurs liés aux données d'IA sur le marché boursier chinois (tels que Readker Culture et CITIC Publishing). Cependant, les entreprises de contenu traditionnelles (éditeurs) doivent passer d'une activité de vente de livres à une activité de vente de données, mais elles se heurtent à de nombreux obstacles, notamment des problèmes de droits d'auteur complexes, un manque de systèmes de tarification et la possibilité que l'IA remplace ces entreprises. La conclusion est que la pénurie de données est sélective (seules les données professionnelles, exclusives et multimodales sont véritablement rares), et les revenus des éditeurs issus de l'IA ne se sont pas encore concrétisés. Leur compétitivité à long terme dépendra de leur capacité à créer continuellement du contenu et à valoriser leurs données.
Analyse détaillée
1. Pourquoi les grands modèles d'IA manquent-ils de « carburant » ? – La crise de la pénurie de données de haute qualité
Les grands modèles d'IA sont comme des usines de raffinage de données : la puissance de calcul est le four, et les données sont l'or. Mais les données ne suivent pas la loi de Moore (la performance double tous les 18 mois), tandis que leur quantité diminue avec l'utilisation :
- Utilisation explosive : GPT-2 nécessitait des dizaines de Go de texte pour son entraînement, tandis que GPT-3 en nécessite des centaines. Les modèles multimodaux actuels (capables de comprendre des images, du texte et des interactions avec des robots) requièrent encore plus de données. Par exemple, l'intelligence incarnée nécessiterait au moins 10 millions d'heures de données multimodales, mais en Chine, il n'y a que 500 000 heures de données d'interaction physique conformes aux réglementations, soit un manque de 99 %.
- Épuisement des sources : Les contenus humains gratuits disponibles sur Internet (blogs, forums, livres) sont presque épuisés. Pire encore, le contenu généré par l'IA (comme les articles écrits par des IA) se mélange aux données, contaminant ainsi les matériaux d'entraînement des modèles suivants.
En bref, l'IA consomme des données beaucoup plus rapidement que les humains ne peuvent en produire.
2. L'effet boomerang du contenu généré par l'IA – Le problème de la contamination des données
Que se passe-t-il si des articles écrits par des IA sont utilisés pour entraîner d'autres IA ? C'est comme faire des copies de copies : chaque nouvelle génération perd en qualité, et le modèle devient progressivement moins performant (par exemple, il ne comprend plus les événements rares ou produit du contenu incorrect). Il existe toutefois des solutions pour atténuer ce problème :
- Filtrage strict : En supprimant clairement le contenu généré par l'IA et en mélangeant des données humaines, on peut limiter la dégradation.
- Les efforts de Silicon Valley : Pour trouver des données de haute qualité, Anthropic a scanné secrètement des livres dans le monde entier (projet surnommé « Plan Panama »). L'entreprise a été poursuivie pour avoir téléchargé 7 millions de livres depuis des bases de données illégales et a finalement payé 1,5 milliard de dollars (la plus grosse indemnisation de l'histoire du droit d'auteur aux États-Unis), ce qui montre à quel point les données de haute qualité sont précieuses mais difficiles à obtenir.
3. Les éditeurs traditionnels deviennent des « mineurs de données » – Le passage de la vente de livres à la vente de données
Auparavant, les éditeurs gagnaient de l'argent en vendant des livres. Aujourd'hui, les entreprises d'IA ont besoin de données de haute qualité, et les éditeurs peuvent exploiter leurs droits d'auteur pour les vendre aux IA. Cependant, plusieurs facteurs compliquent cette transition :
- Différence de prix selon l'utilisation : Les données sont vendues à des prix très différents en fonction de leur utilisation (entraînement des modèles ou recherche en temps réel). Par exemple, HarperCollins et Microsoft ont conclu un accord pour autoriser l'utilisation de livres anciens pour l'entraînement des IA, pour un montant de 5000 dollars par livre toutes les trois années.
- La valeur des données n'est pas uniforme : Les romans ordinaires et les textes publics (comme les Analectes de Confucius) sont abondants et peu valorisés, tandis que les contenus professionnels, exclusifs ou spécialisés (manuels médicaux, jurisprudence, rapports d'industrie) sont rares et donc plus chers.
- La situation en Chine : Des entreprises d'IA achètent déjà des données aux éditeurs, mais ces derniers doivent les numériser, les nettoyer et les annoter. De plus, ils doivent gérer les droits d'auteur (de nombreux auteurs de livres anciens sont inaccessibles, perturbant la chaîne d'autorisation).
4. Les alternatives des entreprises d'IA – Des solutions pour ne pas dépendre des éditeurs
Les entreprises d'IA n'attendent pas que les éditeurs fournissent les données nécessaires ; elles ont des alternatives :
- Création de données synthétiques : Elles peuvent générer elles-mêmes des données de haute qualité (par exemple, des problèmes mathématiques ou du code), ce qui peut remplacer une partie des données réelles.
- Amélioration de l'efficacité des données : Elles améliorent la structure des modèles et les méthodes d'entraînement pour qu'ils apprennent plus avec moins de données.
- Technologies RAG (Retrieval and Generation) : Les modèles n'ont pas besoin de mémoriser tout le savoir lors de l'entraînement ; ils peuvent rechercher des informations en temps réel lorsque nécessaire (par exemple, demander à une IA le PIB pour 2026).
- Autres sources : Elles achètent des données auprès de fournisseurs spécialisés, utilisent des données publiques et légales, ou signent directement avec des auteurs pour contourner les éditeurs.
Ainsi, les droits d'auteur sur les livres ne sont qu'une source de données parmi d'autres.
5. Des obstacles à la rentabilité des éditeurs – Des droits d'auteur aux systèmes de tarification
Même si les éditeurs possèdent des droits d'auteur, ils ne peuvent pas toujours fixer eux-mêmes les prix en raison de trois obstacles majeurs :
- Problèmes de propriété des droits : Les éditeurs n'ont que le droit de publication ; les droits d'auteur sur le texte appartiennent aux auteurs. Pour autoriser l'utilisation des données par les IA, il faut négocier avec chaque auteur individuellement. De nombreux auteurs de livres anciens sont inaccessibles, et les contrats ne prévoient souvent pas l'autorisation pour les IA.
- Absence de systèmes de tarification matures : Comment mesurer la quantité de données utilisées par les IA ? Comment empêcher le détournement des données ? Comment répartir les revenus avec les auteurs ? Il n'existe pas de règles unifiées à cet égard. À l'étranger, il est courant d'acheter des bases de données complètes, mais une tarification basée sur le nombre de mots n'est pas encore généralisée.
- Concurrence des alternatives : Les données synthétiques, les fournisseurs spécialisés et les données open source diluent la pouvoir de négociation des éditeurs. De plus, la gratuité des livres publics (comme les classiques) baisse les prix des livres ordinaires.
Conclusion : Pour être rentables, les éditeurs doivent continuer à produire du contenu original de haute qualité et transformer leurs droits d'auteur en actifs numériques conformes, traçables et négociables. Ils doivent également établir un mécanisme de partage des bénéfices stable entre les entreprises d'IA, les éditeurs et les auteurs. Se contenter de leurs stocks de textes ne suffira pas à assurer leur compétitivité dans l'ère de l'IA.
Conclusion supplémentaire : La raison de la forte hausse des actions liées aux données d'IA sur le marché boursier chinois
La forte augmentation des valeurs des actions dans les secteurs liés aux données d'IA en août n'est pas due à un réel profit des éditeurs, mais plutôt à une surenchère sur la pénurie de données. Actuellement, les systèmes de reconnaissance des droits, de tarification et de partage des bénéfices ne sont pas encore matures, et la plupart des revenus des éditeurs issus de l'IA restent au stade des accords préliminaires. À long terme, la demande en données multimodales (graphiques, vidéo, interactions avec des robots) augmentera, tandis que la valeur des données textuelles diminuera. Les données professionnelles, exclusives et conformes, ainsi que la capacité humaine à créer du contenu original, seront les plus rares et les plus précieuses. Si les créateurs de premier plan ne peuvent pas bénéficier des droits d'auteur, la motivation à produire du contenu de haute qualité diminuera, menant finalement à un manque de ressources pour l'IA. Un développement sain de cette industrie dépend donc de l'équilibre des intérêts entre les entreprises d'IA, les éditeurs et les auteurs.