核心内容总结
美国部分AI公司(如Anthropic、亚马逊)为规避版权风险,大规模购买二手纸质书,扫描成数字文本用于模型训练后销毁原书;这一做法源于美国版权法的特殊规定,而中国AI公司因法律差异无需效仿;同时,这种“毁书”行为可能还隐含垄断独家数据的竞争目的,且存在消耗人类文明实体载体的潜在风险。
详细拆解解读
1. 美国AI公司是怎么“毁书”的?流水线操作像“拆书工厂”
Anthropic的“毁书”项目叫“巴拿马计划”,流程很简单:先从市场买大量二手正版书,运到处理中心后,工人切掉书脊、分开书页,用高速扫描仪把每页变成数字文本(留着训练AI),最后把纸质书直接销毁。现在亚马逊也跟着这么干,二手书商接到的“批量买书”订单越来越多。
不过这不是技术上必须的——比如马斯克的SpaceX AI对珍贵书会小心扫描不破坏书脊,谷歌早年的Google Books项目扫描全书也不毁书。说白了,“毁书”是这些公司权衡后的选择,不是没办法的办法。
2. 美国版权法为啥逼得公司毁书?怕吃版权官司
美国法律有个特点:你买了一本正版书,想转卖、送人甚至销毁都没问题(这叫“首次销售原则”),但如果扫描成电子版还留着纸质书,就可能被认定为“非法复制”(侵犯作者的复制权)。而如果扫描后把纸质书销毁,公司就能辩解说:“我只是把纸质版换成了电子版,没多复制一份”,这样版权风险就低很多。
之前Anthropic因为从盗版网站下了700万本书训练模型,被法院判赔15亿美元,吃了大亏。所以现在宁愿花几千万买二手书销毁,也不想再碰盗版的雷。
3. 除了合规,还有没别的目的?可能想垄断独家内容
为啥OpenAI和谷歌没这么干?有人怀疑这些公司毁书还有“私心”:如果把一些少见的孤本、绝版书销毁了,只有他们的AI模型里留着这些内容,其他公司的模型就没有,这样就能形成独家竞争力。毕竟AI模型的训练数据越独特,性能可能越有优势。
4. 中国AI公司为啥不用毁书?法律规定不一样
中国的版权法和美国不同:不管你扫不扫描后销毁纸质书,只要公司把扫描的内容用来训练AI,都得先得到作者或出版社的许可(因为扫描本身就是“复制”行为)。所以中国公司就算学美国毁书,也不能规避侵权风险——该拿授权还是得拿,毁书反而多此一举,浪费钱。
5. 毁书的隐忧:人类文明会不会丢一部分?
纸质书是人类文明的实体载体,如果AI公司把书销毁了,万一哪天公司倒闭、模型停用,这些书的内容就再也找不回来了。比如一本绝版的老书,被扫描后销毁,要是模型没了,这部分文化就真的消失了。这种“破坏式”获取数据的方式,其实是在消耗人类文明的“备份”。
总的来说,美国AI公司毁书是“法律逼的+商业算的”,但背后藏着对文明载体的风险;中国公司不用这么做,是因为法律逻辑不同。这件事也提醒我们:AI发展不能以牺牲人类文化遗产为代价。