核心内容の要約
アメリカのAI企業(アマゾンやAnthropicなど)は、大規模なAIモデルの訓練に必要なデータが不足している問題を解決するため、中古の古本(希少本や絶版本を含む)を大量に購入し、その内容をスキャンした後で物理的な本を破棄しています。この行為の背後には、AIが「人間によって書かれた高品質なデータ」を切望しているという事情があります。また、アメリカの裁判所の判決により(物理的な本を購入して破棄した後でも電子版を保持することは「合理的な利用」と見なされているため)、古本の破棄はコンプライアンスに適合し、かつ低コストな方法となっています。しかし、これにより希少な知識が失われ、一般の人々がそれにアクセスできなくなるという論争も生じています。
1. なぜAIは古本を狙うのか?インターネット上のデータだけでは不十分
AIの大規模モデルの訓練には大量の「人間が書いた実際のコンテンツ」が必要ですが、インターネット上のデータはすでにほとんど使い尽くされています:
- 古いデータは使い古されている:過去のニュースやフォーラム、ブログなどは、すでに多くのAI企業によって何度も利用されています。
- 新しいデータは信頼できない:現在インターネット上にある多くのコンテンツはAI自身によって生成されており、これらのデータで次世代のモデルを訓練すると、モデルの性能が低下する(人間が自分で吐き出した食べ物を食べ続けると愚かになるようなもの)。
- 古本は「貴重なデータ」:数十年前の古本にはAIが生成したコンテンツが含まれておらず、著者や編集者による厳格なチェックも受けており、品質が高い。また、マイナーな専門書やニッチな著作の多くはデジタル化されておらず、AIにとって新鮮な資源となっています。
そのため、かつては注目されなかった古本が、突然AI企業にとって非常に貴重なものとなっています。
2. なぜスキャンした後に破棄するのか?合法的でコストも節約できる
AI企業は慈善家ではなく、破棄には計算がある:
- 法的に「コンプライアンスを満たしている:アメリカの裁判所の判決により、AI企業が物理的な本を購入し、スキャンした後で原本を破棄しても、それは「1冊の本が電子版に置き換わる」だけであり、著作権侵害には該当しない。しかし、原本を保持すると「1冊の物理的な本+1冊の電子版」となり、違法になる可能性がある。
- 効率が高い:本の背表紙を取り除くと、数百ページの紙を高速スキャナーに直接投入でき、ページを1枚ずつめくってスキャンするよりもはるかに速い(数百万冊の本を処理する場合、この違いは無視できない)。
- コストが低い:スキャンされた古本は倉庫を占め、輸送費もかかるが、破棄することで保管や輸送のコストを節約できる。
例えばAnthropicの「パナマ計画」では、6ヶ月で50万~200万冊の本を処理し、破棄することが最もコスト効果的な選択となっている。
3. 稀少本の破壊:知識の「絶滅」危機
最も問題なのは、破壊されるのが普通の古本だけでなく、希少本や絶版本も含まれていることです:
- 再生不可能:これらの本は世界中で数冊しかなく、破壊されると二度と手に入らなくなる。
- 知識が「私有財産」になる:古本は元々書店や図書館で購入・収集することができたが、AI企業が購入してスキャンすると、その内容は企業の内部データベースの一部となり、一般の人々はもはやアクセスできなくなる。デジタル化は知識の普及を促すはずですが、結果として公共の知識がAI企業の「私有財産」になってしまっている。
マスクでさえこれには耐えられず、xAIチームに対して希少本に遭遇した場合は非破壊的なスキャン方法(例えばGoogle Booksのような方法)を使用し、原本を図書館に保管するよう要求しました。しかし、この方法は効率が低くコストも高いため、AI企業が積極的に採用するとは限りません。
4. 法的判決:意図せず「焼書」を促しているのか?
アメリカの裁判所の判決が重要な転換点となりました:
- 海賊版は通用しない:Anthropicは以前、海賊版サイトから電子書籍をダウンロードし、作家から訴えられて15億ドルの賠償を支払った。
- 破壊が「正当な方法」となる:裁判所は「物理的な本を購入して破棄し、電子版を保持する」方法を認めたため、AI企業にとってコンプライアンスを満たすための近道ができた。
これにより、奇妙な論理が生まれています:本を盗む(海賊版をする)とお金を支払わなければならないが、本を購入して破棄することは合法となる。法律は「焼書」を強制していないが、結果として「焼書」を許可してしまっているのだ。
5. 未来の懸念:さらなる「焼書」が増えるのか?
このような方法が他のAI企業にも広まれば:
- 「破壊」が標準的な操作となる:著作権リスクを避け、コストを削減するために、古本の破壊が「コスト削減の手段」として定着する可能性がある。
- 知識の閉鎖が進む:AI時代以前の人間の知識の多くが、公開されていた物理的な本からAI企業の閉鎖的な訓練データに変わってしまう。
- 希少な知識の消失:デジタル化されていない絶版本は、AI企業の破砕機の中で永遠に消えてしまうかもしれない。
現在Anthropicを非難しているマスクでさえ、将来的には「効率優先」のために破壊を選択するかもしれません。結局のところ、より優れたAIモデルを訓練することがAI企業にとって最も重要なことなのです。
この問題の本質は、「AIの発展」と「人間の知識の保護」との衝突です。AIにはデータが必要ですが、人間は貴重な知識が破砕機の中で消えてしまうのを許してはなりません。この両者のバランスをどのように取るかは、将来のAI規制が避けて通れない問題かもしれません。