虎嗅

**「計算能力に続くのはコーパスデータ――AIの新たなボトルネックがコンテンツ産業の価格設定権を再構築しているのか?」** この見出しは、AI技術の発展に伴う新たな課題とそれがコンテンツ産業に与える影響を指摘しています。計算能力の向上に続き、AIが利用するデータ(コーパスデータ)の質や量が重要な要素となりつつあります。この問題は、コンテンツの制作・配信プロセスや価格設定に大きな変化をもたらす可能性があります。金融ニュースウェブサイトでは、このような技術的・市場的な動向を解説する記事がよく掲載されます。

原文:算力之后是语料:AI的新瓶颈正在重塑内容产业的定价权?

核心内容の要約

このニュースは、「AI大規模モデルにおける高品質なコーパスの不足」という中心的な問題を取り上げています。AIモデルのパラメータサイズが拡大し(数千億から数兆に)、マルチモーダルへと進化する中で(画像・テキスト・ビデオ・インタラクティブデータの需要が急増)、インターネット上の高品質なデータが徐々に枯渇しており、AIが生成するコンテンツがデータプールを汚染し、「モデルの崩壊」のリスクを引き起こしています。そのため、資本はA株市場におけるAIコーパス関連セクター(例:読客文化、中信出版)に注目しています。しかし、従来のコンテンツ提供者(出版社)が「書籍の販売」から「データの販売」へと転換するには、著作権の複雑さ、価格設定システムの欠如、AIによる代替可能性など、多くの障壁が存在します。最終的な結論として、コーパスの不足は「階層的」であり(専門的・独占的・マルチモーダルデータが本当に不足している)、出版企業のAI関連収入はまだ実現しておらず、長期的な競争力は継続的な創造能力とデータ資産化の能力にかかっています。

詳細な解説

1. なぜAI大規模モデルは「燃料不足」を訴えるのか?——高品質コーパスの危機

AI大規模モデルは「データ精製工場」のようなもので、計算能力が炉であり、データが鉱石です。しかし、データと計算能力は異なります:計算能力にはムーアの法則(18ヶ月ごとに性能が倍増)がありますが、データは使えば使うほど減少します:

  • 使用量の爆発的増加:GPT-2のトレーニングには数十GBのテキストが必要でしたが、GPT-3には数百GBが必要です。現在のマルチモーダルモデル(画像・テキスト・ロボットのインタラクションを理解するAI)にはさらに大量のデータが必要です。例えば、エンバデッドインテリジェンスには少なくとも1000万時間分のマルチモーダルデータが必要ですが、国内で合法的に入手可能な物理的なインタラクションデータは50万時間分しかありません。
  • 供給源の枯渇:インターネット上の無料の人間作成コンテンツ(ブログ、フォーラム、書籍など)はほとんど使い果たされつつあります。さらに悪いことに、AIが生成するコンテンツ(例:AIが書いた記事)がデータプールに混入し、次世代モデルのトレーニング素材を汚染しています。

簡単に言えば、AIがデータを消費する速度は、人間が高品質なデータを生成する速度をはるかに上回っています。

2. AI生成コンテンツの「ブーメラン効果」——自己汚染の問題

AIで書かれた記事を使って再びAIをトレーニングするとどうなるでしょうか?これは「コピーをコピーする」ようなもので、各世代で情報が失われ、モデルは徐々に劣化します(例:珍しい出来事を理解できなくなったり、誤った内容を出力したりする)。これを「モデルの崩壊」と呼びます。

  • 対策:すべてのAIコンテンツが有害というわけではありません。明らかにAI生成されたものを除外し、人間作成のデータと混合し、重複を除去することで劣化を抑制できます。
  • シリコンバレーの狂気的な取り組み:クリーンな人間作成のデータを探すために、Anthropicは世界中の書籍を秘密裏にスキャンしています(「パナマ計画」と呼ばれる)。しかし、海賊版ライブラリから700万冊の書籍をダウンロードしたとして訴えられ、最終的に15億ドルの和解金を支払いました(アメリカの著作権史上最大の和解例)。これは、クリーンな人間作成データがどれほど貴重でありながら入手が困難かを示しています。

3. 従来の出版社が「AI鉱山労働者」に変わる——書籍販売からデータ販売への転換

以前は出版社が書籍を売って収益を上げていましたが、今ではAI企業が高品質なデータを必要としています。出版社は著作権を持つコンテンツをAIに販売することができます:

  • 用途による価格の大きな違い:AIがデータを購入する際には、「モデルのトレーニング」(高価)と「検索(例:リアルタイムで情報を調べる)」(安価)によって価格が大きく異なります。すべての著作権が高値で売れるわけではありません。例えば、ハーパーコリンズとマイクロソフトは協力し、古書を1冊あたり3年間5000ドルでライセンスしています(著者と出版社が半分ずつ)。
  • すべてのコンテンツが価値があるわけではない:一般的な小説やパブリックドメインの古典(例:『論語』)は供給過多で価値がありません。専門的・独占的・特定分野のコンテンツ(例:医学教科書、法律判例、業界の詳細なレポート)が不足しており、高値で売れます。
  • 国内の現状:すでにAI企業が出版社からデータを購入していますが、出版社はデジタル化、クリーニング、ラベル付けなどの作業を行う必要があり、著者のライセンス問題も解決する必要があります(多くの古書の著者と連絡が取れないため)。

4. AI企業の代替案——書籍を買わなくても生き残れる方法

AI企業は出版社がデータを提供するのを待つだけではありません。彼らには以下のような代替策があります:

  • 合成データ:AI自身が高品質なデータを生成します(例:数学の問題やコード)。これにより、一部の実際のデータを置き換えることができます(例:数学分野では、合成データの方が実際のデータよりも効果的です)。
  • データ処理の効率化:モデルアーキテクチャを改善し(例:MoEを使用して必要な部分のみを活性化する)、トレーニング方法を最適化することで、より少ないデータでより多くの情報を学ぶことができます。
  • RAG技術:モデルは事前トレーニング時にすべての知識を覚える必要はなく、必要な際にリアルタイムで情報を検索します(例:AIに「2026年のGDPは?」と尋ねると、データベースから直接調べます)。
  • その他の情報源:専門的なデータサービスプロバイダーからデータを購入したり、公開された合法的なデータを利用したり、著者と直接契約したりします。

つまり、従来の書籍の著作権はデータソースの一つに過ぎず、AI企業にとって必須ではありません。

5. 著作権から価格設定権へ——出版社が収益を上げるための3つの障壁

出版社が著作権を持っていても、価格設定権を得られるとは限りません。以下の3つの大きな障壁があります:

  • 著作権の所有権の混乱:出版社には「出版権」しかなく、テキストの著作権は著者にあります。AIのトレーニングに使用するためには、著者一人ひとりと交渉する必要があります。しかし、多くの古書の著者と連絡が取れず、契約にAI使用の条項がないため、うまくいくケースは非常に少ないです。
  • 価格設定システムの未熟さ:AIがどれだけのデータを使用したかをどのように計算するか?データの盗用を防ぐ方法は?著者にどのように分配するか?これらには統一された規則がありません。現在、海外では「データベース全体を一括で購入」するのが一般的ですが、文字単位での正確な取引はまだ実現していません。
  • AIによる代替供給:合成データ、専門的なサービスプロバイダー、オープンソースデータ、著者との直接契約などが出版社の交渉力を弱めています。また、パブリックドメインの書籍(例:古典)は無料であり、一般書籍の価格を押し下げています。

結論:出版社が価格設定権を持つためには、古書をただ保管するだけでは不十分です。継続的に高品質なオリジナルコンテンツを生産し、著作権を「合法的で追跡可能で取引可能なデータ資産」に変える必要があります。また、AI企業、出版社、著者の間で安定した利益分配メカニズムを確立する必要があります。単に既存のテキストだけでは、AI時代の競争力を築くことはできません。

最後に:A株市場の急騰の真相

8月にAIコーパス関連セクターが一斉に値上がりしたのは、出版社が実際にAIから収益を得たからではなく、「コーパス不足」という新しい話題に資本が投じたからです。現在、著作権の確定、価格設定、利益分配のシステムはまだ未熟であり、出版社のAI関連収入はほとんど「意向協定」の段階に留まっています。長期的に見ると、マルチモーダルデータ(画像・テキスト・ビデオ・インタラクション)の需要は増加し続け、純粋なテキストコーパスの重要性は低下するでしょう。本当に不足しているのは、専門的・独占的・合法的なマルチモーダルデータと、継続的な人間の創造能力です。

もし一流のクリエイターがAIライセンスから利益を得られなければ、高品質なコンテンツの生産意欲は減少し、最終的にAIも機能しなくなるでしょう。したがって、この業界の健全な発展には、AI企業、出版社、著者の三者間の利益バランスが必要です。