虎嗅

AI公司抢购2022年前的旧书:机器越会写,人类数据越值钱

该文章尚未提供 Español 解读,以下为中文版内容。

核心内容总结

AI公司现在开始抢着买2022年以前出版的旧书,原因是互联网上AI生成的内容(被称为“AI泔水”)越来越多,用这些内容训练模型会导致“模型崩塌”(就像反复复印复印件,细节越来越模糊)。旧书是纯人类写的、无法被AI篡改的真实文本,成了优质训练数据。同时,法律上有个空子:买实体书扫描成数字副本后销毁原件,属于“合理使用”,比下载盗版书安全。中间商(比如ISBNdb)看到商机,帮AI公司批量找旧书,但后来又撤下服务(可能是公关)。这件事暴露了AI时代的新趋势:真实、有出处、能证明不是机器编的数据,才是最值钱的。

一、AI为啥突然爱上旧书?因为互联网“泔水”太多了

你可能会问:AI不是已经读遍互联网了吗?为啥还要找旧书?

答案在“2022年”这个时间点——ChatGPT是2022年11月发布的,之后大量AI生成的内容(比如文章、商品介绍、论文摘要)开始“回灌”互联网。现在你在网上看到的内容,可能是AI抄AI、改AI的“四手货”,就像“泔水”一样没营养。

如果AI用这些内容训练下一代模型,会发生什么?就像拿复印件再复印:第一次复印可能还清晰,第二次细节开始丢,第三次更模糊,最后只剩一团糊。这就是“模型崩塌”——AI会越来越笨,失去细节和创造力。

而2022年前的旧书不一样:它是人类写的,印在纸上,没法被AI篡改。哪怕是本烂书,也是“纯人类烂书”,没有AI的污染。AI买旧书,其实是买“干净的人类文本”。

二、法律空子怎么钻?买实体书扫描销毁竟合法

这里有个反常识的案例:Claude的母公司Anthropic,早年偷过盗版电子书训练模型,后来怕被告,换了个骚操作——

他们花几百万美元买实体书,切掉书脊、高速扫描成数字文件,然后把纸书销毁,只留内部数字副本(叫“巴拿马项目”)。

美国法官后来判:这种操作合法!为啥?法官拆成了三步:

1. 用书训练模型=合理使用;

2. 买实体书→转数字副本→销毁原件→不对外传播=合理使用;

3. 但直接下载盗版PDF→存进资料库=不合法。

简单说:只要你真金白银买了书,只做一份内部数字版,不扩散,就不算侵权。Anthropic这招既避开了盗版风险,又拿到了干净数据,够“精妙”吧?

三、中间商嗅到商机:帮AI找旧书成新业务

有需求就有市场。ISBNdb这家老牌图书数据公司,本来是做图书信息查询的(比如ISBN号、库存),现在专门给AI公司提供“旧书采购服务”:

  • 按AI公司的书单,从旧书店、图书馆、绝版目录里批量找书;
  • 一次能买1000到100万本;
  • 还能帮客户“隐身”(当中间人,不让出版社知道是AI公司买的)。

不过404 Media报道后,他们撤下了服务页面,说“只是探索需求”——但这大概率是公关辞令,毕竟只要AI还需要干净数据,这生意就会继续。

四、真实数据才是金矿:不是机器编的才值钱

这件事最关键的不是AI毁了多少书,而是它揭示了AI时代的稀缺品:真实、有出处的数据。

旧书值钱,不是因为字多,而是因为它经过了“人类筛选链”:有人选题、有人写、有人编辑、有人买(读者用钱包投票)。这套流程不完美,但留下了“真实世界的选择记录”——不是机器随便编的。

不止旧书,日常里的真实数据都值钱:

  • 服装电商的买家秀(真实用户反馈,不是AI刷的);
  • 工厂的生产失败数据(真实错误,AI编不出来);
  • 医院的病例记录(真实病情,不是模拟的)。

以后最昂贵的数据,不是秘密数据,也不是大数据,而是能说清“从哪来、谁判断过、为啥可信”的数据。

写在最后

AI越会生成内容,“非AI生成”的内容就越珍贵。旧书的故事,其实是给我们提了个醒:在机器能造无穷文字的时代,人类的真实创造和选择,才是最不可替代的价值。