虎嗅

一个小小的追踪器,揭开了AI 公司们隐蔽的角落

核心内容总结

有神秘大客户通过二手书商大量收购冷门稀有书籍,媒体用追踪器发现这些书最终被运到亚马逊拉斯维加斯仓库,工人将其切脊、扫描内容后碎纸销毁——目的是为AI大模型提供“独家训练数据”。这件事被媒体比作美国版“焚书坑儒”,引发了AI数据获取与文化遗产保护的争议。

详细拆解解读

1. AI为啥偏要“啃”冷门稀有书?——大模型的“挑食”逻辑

AI大模型训练就像人学习,需要读大量“没见过的知识”才能变聪明。热门书(比如经典小说、教材)的内容早就被数字化了,很多AI模型已经学过,重复用这些数据对模型提升不大。而冷门稀有书(比如几十年前的小众学术著作、绝版地方志、老杂志)大多没被扫描成数字版,是AI眼里的“新鲜食材”——用这些独特内容训练,能让模型知道更多别人不知道的冷知识,回答问题更全面。另外,这些书的版权可能已经过期(比如超过作者去世50年),或者版权方找不到,AI公司用起来没那么多法律麻烦。

2. “焚书坑儒”的比喻夸张吗?——实体书的死亡 vs 知识的留存

媒体用“焚书坑儒”这个词,主要是想强调对实体文化载体的破坏,但和历史事件本质不一样:

  • 历史上的焚书坑儒是为了消灭思想、镇压学者;这里是销毁实体书,但内容被扫描保存到AI里(相当于把书的“灵魂”抽出来,扔了“身体”)。
  • 但问题在于,很多稀有书的价值不止是文字:比如有些书有作者手写批注、旧时代的藏书票、独特的装帧设计,这些是扫描不出来的;还有孤本(全世界只有一本),实体没了,万一扫描过程出错,内容也可能永久丢失。所以对文化研究者来说,这确实是一种损失——就像把故宫的文物拆了,只留下照片。

3. 链条上的参与者:谁在“帮凶”?谁被蒙在鼓里?

  • 二手书商:大多不知道这些书的最终命运,只觉得来了个“大客户”,能清掉积压的冷门库存,赚点钱。他们可能也好奇,但客户不说,他们也不会深究。
  • 亚马逊仓库工人:按流程干活——切书脊(方便扫描内页)、扫描内容、碎纸。他们可能知道是“处理书籍”,但未必清楚是给AI训练用,更想不到这些书是稀有版本。
  • 神秘客户:大概率是AI公司或专门给AI提供数据的服务商。他们之所以隐秘操作,是怕被骂“破坏文化”,或者不想让竞争对手知道自己在抢这些独特数据。

4. 争议焦点:AI进步要牺牲文化遗产吗?

这件事戳中了一个矛盾:AI需要海量数据才能发展,但获取数据的方式可能伤害文化。

  • 支持方说:AI是未来,扫描这些书能让知识被更多人(通过AI)用到,总比让它们在仓库里积灰强。
  • 反对方说:稀有书是文化遗产,实体存在本身就有价值。比如一本19世纪的植物图鉴,不仅有文字,还有当时的手绘插图和科学家的笔记,这些是AI数据代替不了的。而且如果大家都这么干,以后想找实体稀有书会越来越难。
  • 中间派建议:能不能换个方式?比如和图书馆合作,扫描稀有书的数字版,但保留实体;或者AI公司出钱修复这些书,再扫描——既拿到数据,又保护了文化。

5. 对普通人有啥影响?——找书更难,AI更“博学”

  • 找稀有书变难:如果你是二手书爱好者,或者需要找某本冷门专业书,可能会发现市面上的货被AI公司扫光了,价格也被炒高。
  • AI回答更“冷门”:以后问AI一些冷僻问题(比如“1980年某小地方的农业政策”“几十年前的小众科幻小说情节”),它可能答得更准确——因为它“读”过这些稀有书。
  • 文化记忆的缺失:如果越来越多的稀有实体书被销毁,我们可能会失去和过去对话的“实物桥梁”——比如你想摸一摸爷爷那辈看过的旧书,以后可能只能看AI里的数字版了。

这件事本质上是技术发展和文化保护的碰撞:AI需要“喂饭”才能长大,但不能把文化遗产当“饲料”。未来可能需要更合理的规则,让AI和文化都能好好活下去。