虎嗅

Anthropicとアマゾンはなぜ正規の書籍を破棄するのか?

原文:Anthropic和亚马逊为什么要销毁正版图书?

核心内容の要約

アメリカの一部のAI企業(AnthropicやAmazonなど)は、著作権リスクを避けるために大量の中古紙の本を購入し、それらをデジタルテキストに変換してモデルのトレーニングに使用した後で元の本を破棄しています。この慣行はアメリカの著作権法の特別な規定に基づいており、中国のAI企業は法的な違いからこれを真似る必要はありません。また、この「本の破壊」行為には独占的なデータを持つための競争目的も隠されており、人類文明の物理的な媒体を消費する潜在的なリスクも存在します。

詳細な解説

1. アメリカのAI企業はどのようにして「本を破壊」しているのか?

Anthropicの「本の破壊」プロジェクトは「パナマ計画」と呼ばれ、その手順は非常にシンプルです。まず市場から大量の中古正規書籍を購入し、処理センターに運びます。そこで作業員が本の背表紙を切り取り、ページを分け、高速スキャナーを使用して各ページをデジタルテキストに変換します(AIのトレーニング用に)。最後にその紙の本を直接破棄します。現在、Amazonも同様の方法で行っており、中古書店からの「大量購入」の注文が増えています。

しかし、これは技術的に必須なわけではありません。例えば、マスクのSpaceXのAIは貴重な本を慎重にスキャンし、背表紙を破損しないようにしていますし、Googleの初期のGoogle Booksプロジェクトでも本全体をスキャンしても破棄していませんでした。つまり、「本の破壊」はこれらの企業が判断した結果であり、やむを得ない手段ではありません。

2. アメリカの著作権法はなぜ企業に本の破壊を強いるのか?

アメリカの法律には特徴があります。正規書籍を購入して転売したり、プレゼントしたり、破棄したりすることは問題ありません(これを「初回販売原則」と呼びます)。しかし、それを電子版に変換しても紙の本を保持している場合、「違法な複製」と見なされる可能性があります(著者の複製権を侵害することになります)。一方で、スキャン後に紙の本を破棄すれば、企業は「紙の版を電子版に変えただけで、追加でコピーしていない」と主張できるため、著作権リスクが大幅に低減します。

以前、Anthropicは海賊版サイトから700万冊の本をダウンロードしてモデルのトレーニングに使用した結果、15億ドルの損害賠償を命じられました。そのため、今では数千万ドルをかけて中古書を購入して破棄することを選んでいます。

3. コンプライアンス以外に他の目的はあるのか?独占的なコンテンツを持つためかもしれない

OpenAIやGoogleはなぜこのような行為をしていないのでしょうか?一部の人々は、これらの企業が本を破壊するには「私心」があると疑っています。希少な孤本や絶版書を破棄すれば、そのコンテンツは自社のAIモデルだけに残り、他社のモデルには含まれないため、独占的な競争力が生まれると考えられています。結局のところ、AIモデルのトレーニングデータがよりユニークであればあるほど、その性能には優位性が出る可能性があります。

4. 中国のAI企業はなぜ本を破壊しないのか?法律の規定が異なる

中国の著作権法はアメリカとは異なります。スキャン後に紙の本を破棄するかどうかに関わらず、企業がそのデータをAIのトレーニングに使用する場合は、著者や出版社の許可を得る必要があります(スキャン自体が「複製」行為だからです)。したがって、中国の企業がアメリカの方法を真似ても著作権侵害のリスクを避けることはできません。許可を得なければならないので、本を破壊することは無駄な行為になります。

5. 本の破壊がもたらす懸念:人類文明は失われるのか?

紙の本は人類文明の物理的な媒体です。AI企業が本を破棄した場合、企業が倒産したりモデルの使用を停止したりしたときに、その内容を再び入手することはできなくなります。例えば、絶版の古い本がスキャンされて破壊された場合、モデルがなくなればその文化も本当に失われてしまいます。このような「破壊的」なデータ取得方法は、人類文明の「バックアップ」を消費していると言えます。

要するに、アメリカのAI企業が本を破壊するのは「法律によるもの+商業的な計算」に基づいていますが、その背後には文明の媒体を失うリスクが隠されています。中国の企業がこれを行わないのは法的な論理が異なるからです。この事実は、AIの発展が人類の文化遺産を犠牲にしてはならないことを私たちに思い出させてくれます。