核心内容总结
美国AI公司(如亚马逊、Anthropic)为解决大模型训练数据枯竭问题,大量购买二手旧书(包括稀有绝版书),扫描内容后将实体书销毁。这一行为背后是AI对“人类真实高质量数据”的迫切需求,同时因美国法院判决(买实体书销毁后保留电子版属“合理使用”),让“销毁旧书”成为合规且低成本的操作,但也引发了稀有知识消失、公众失去接触机会的争议。
一、AI为啥抢旧书?网上的“饭”不够吃了
AI大模型训练需要大量“人类写的真实内容”,但互联网数据已经被挖空了:
- 老数据被榨干:过去新闻、论坛、博客等容易抓的内容,早被各家AI公司反复用烂了;
- 新数据被污染:现在网上很多内容是AI自己生成的,如果用这些“AI写的东西”训练下一代模型,会导致“模型坍缩”——就像人总吃自己吐出来的饭,会越来越傻,生成的内容单一甚至胡言乱语;
- 旧书是“黄金数据”:几十年前的旧书没有AI内容,还经过作者、编辑多层审核,质量高;而且很多冷门专业书、小众著作没被数字化,是AI没吃过的“新鲜饭”。
所以,过去无人问津的旧书,突然成了AI公司眼里的香饽饽。
二、为啥扫完就销毁?合法又省钱
AI公司不是慈善家,销毁旧书是算过账的:
- 法律上“合规”:美国法院判决,AI公司合法买一本实体书,扫描后销毁原件,相当于“一本变一本”(电子版替代实体版),不算侵权;但如果留下实体书,就变成“一本实体+一本电子版”,反而可能违法;
- 效率更高:切掉书脊后,几百页纸能直接塞进高速扫描机,比一页页翻书扫描快多了(处理几百万本书时,这个差别大到不能忽略);
- 成本更低:扫描完的旧书占仓库、要运费,销毁反而省了存储和运输费。
比如Anthropic的“巴拿马计划”,6个月处理50-200万本书,销毁是最划算的选择。
三、稀有书被毁:知识的“灭绝”危机
最让人愤怒的是,被销毁的不只是普通旧书,还有稀有、绝版书:
- 不可再生:这些书可能全世界只有几本,销毁了就再也没了;
- 知识变“私产”:旧书原本在书店里,普通人或图书馆还有机会买到/收藏;但AI公司买走扫描后,内容变成企业内部数据库的一部分,公众再也接触不到——数字化本应让知识更易传播,结果却把公开知识变成了AI公司的“私有资产”。
马斯克都看不下去了,要求xAI团队遇到稀有书时,用非破坏性扫描(比如Google Books的方式),把原件存进图书馆,但这种方式效率低、成本高,AI公司未必愿意做。
四、法律判决:无意中鼓励“焚书”?
美国法院的判决成了关键转折点:
- 盗版路走不通:Anthropic之前从盗版网站下载电子书,被作家告上法庭,赔了15亿美元;
- 销毁成“正道”:法院认可“买实体书销毁+留电子版”的做法,让AI公司找到了合规的捷径。
这就形成了一个荒唐的逻辑:偷书(盗版)要赔钱,买了书再销毁反而合法。法律没要求“焚书”,但无意中给“焚书”发了通行证。
五、未来隐忧:更多“焚书”会来吗?
如果这种做法被更多AI公司效仿:
- “销毁”成标准操作:为了规避版权风险、降低成本,销毁旧书可能从“省钱办法”变成“行业惯例”;
- 知识封闭加剧:越来越多前AI时代的人类知识,会从公开流通的实体书,变成AI公司的封闭训练数据;
- 稀有知识消失:那些没被数字化的绝版书,可能在AI公司的碎纸机里永远消失。
现在骂Anthropic的马斯克,未来会不会也因为“效率优先”而选择销毁?谁也说不准——毕竟,训练出更好的大模型,才是AI公司最关心的事。
这件事本质上是“AI发展需求”和“人类知识保护”的冲突:AI需要数据活下去,但人类不能让珍贵的知识在碎纸机里灭绝。如何平衡两者,可能是未来AI监管绕不开的问题。