
AI公司对训练数据的争夺,已经从互联网爬虫、盗版电子书和内容授权,延伸到了二手书店与纸质书仓库。
一条在X上引发广泛讨论的贴文称,AI公司正在大量购买旧书和稀有书籍,使用高速设备切掉书脊、拆散书页、扫描文字,再销毁纸质原件。埃隆·马斯克随后回应称,他已经要求SpaceXAI团队保存图书馆中的珍本书籍,采用更费力但完整的方式扫描,而不是直接切掉书脊。
这件事最需要分清两层证据:Anthropic曾购买并破坏性扫描数百万册纸质书,已经被美国联邦法院文件明确证实;近期稀有书和绝版书可能进入类似采购链,则来自欧洲旧书商、数据供应商市场和媒体调查,目前还不能证明Anthropic销毁了某些“最后存世本”。

法院文件确认:Anthropic买了数百万册书,再把书脊切掉
在作家Andrea Bartz等人起诉Anthropic的版权案件中,美国加州北区联邦法院披露了这条工业化流程。
法院文件显示,Anthropic在2024年2月聘请Tom Turvey负责获取纸质书。Turvey此前曾负责Google图书扫描项目的合作伙伴关系,他在Anthropic的任务被描述为取得“世界上所有的书”,同时尽量减少法律、业务和实践障碍。
随后,Anthropic团队联系大型图书分销商和零售商,以“研究图书馆”名义批量采购纸质书。公司花费数百万美元买下数百万册书,其中许多是二手书。服务商拆掉装订、把书页切成适合高速设备处理的尺寸,逐页扫描为带有机器可读文字的PDF,最后丢弃纸质原件。
这些数字化书籍被放入Anthropic内部的中央研究图书馆,其中部分子集进入模型训练数据混合,用于改善Claude的性能。法院记录还显示,Anthropic此前从Books3、LibGen和Pirate Library Mirror取得了超过700万份明知属于盗版的电子书副本。购买纸书并扫描,是公司在法律风险上对盗版数据路线的一种替代。
法院没有“命令企业毁书”,但毁掉原件确实帮助了合理使用抗辩
社交媒体最容易误读的一点,是“法官要求AI公司销毁原书”。实际判决并没有规定企业必须毁书,也没有给所有纸质书扫描发放无限许可。
William Alsup法官在2025年6月的裁定中,把Anthropic的行为分成了不同类别:使用作品训练能够生成新文本的模型,被认定具有高度转换性;把合法购买的纸质书转换成内部数字副本,也在该案具体事实下构成合理使用;但从盗版网站下载并永久保存中央图书馆副本,并不能因为未来可能用于AI训练就自动成为合理使用。
纸书扫描部分之所以获判有利,一个关键事实是“一本换一本”:Anthropic购买了一册纸书,扫描时销毁它,只保留一份内部数字替代品,没有向公司外部分享或出售。法院认为,这一格式转换改善了存储和检索,没有增加流通副本数量。
这项裁定的危险激励在于,企业可能发现:保留原书并同时持有数字副本,会让版权论证变得更复杂;销毁纸书、强调只存在一份替代副本,反而更容易建立“一对一格式转换”的法律叙事。法律没有下令撕书,却可能让撕书成为风险更低的流程设计。
为什么AI公司突然开始寻找2022年以前的旧书?
高质量书籍一直是训练语言模型的重要数据。与社交媒体帖子和廉价网页相比,书籍经过作者、编辑和出版流程,通常拥有更完整的长篇结构、更稳定的语言质量,以及大量在公开互联网中稀缺的专业、地方和非英语知识。
生成式AI普及后,互联网新增内容越来越多地包含机器生成文本。模型继续抓取网络,可能吃回自己或竞争对手生成的内容,造成数据质量下降、风格同质化和错误循环。旧书尤其是2022年前出版的书,因此成为一种“没有AI污染”的高密度语料。
媒体调查显示,原本经营书籍元数据的ISBNdb已经把为AI客户采购实体书发展成业务,可以按照年代、主题、语言等条件处理从数千到上百万册的订单,并向客户提供保密安排。欧洲多个国家的旧书商也报告收到异常大、筛选范围很宽的批量订单。
从AI公司的角度看,这是一条可扩展的数据供应链;从旧书市场看,它却可能像一种没有保存标准的文化资源开采。
“稀有书正在被销毁”有现实风险,但证据不能被夸大
目前能够确认的是,大规模破坏性扫描真实存在,数据采购方正在寻找旧书,部分供应商能够处理数量巨大的实体书订单;书商库存中又确实包含绝版、外语、小众和流通量极少的版本。
但公开法院记录没有证明Anthropic专门寻找珍本,也没有列出某本18世纪书籍的最后几册已被其销毁。此前分析Anthropic项目的报道也明确指出,法院文件无法证明被扫描的书中包含稀有书。
真正的风险来自采购方式:当买家按年代、语言或主题批量下单,供应链缺少藏品级筛查,扫描商又以速度和成本为目标时,一本文化价值远高于其二手售价的书,可能被当成普通纸张进入切割机。对于只有少量市场存量、保存情况不明的版本,这种损失可能不可逆。
因此,合理标题不是“AI公司已经销毁所有珍本”,而是:已经被法院确认的百万册级破坏性扫描流程,如今正在进入更广泛的旧书采购市场,稀有书商有充分理由要求行业建立保护门槛。
马斯克要求SpaceXAI改用无损扫描,但目前仍是一项公开承诺
马斯克在原帖下回应称,他已经要求SpaceXAI团队保存图书馆中的任何珍本书籍,并以更费力但完整的方式扫描,而不是简单切掉书脊。
无损扫描并不是不存在。图书馆和档案机构长期使用V形书托、上方相机、低压力翻页和专门的装订保护流程,可以在不拆书的情况下制作高质量数字副本。代价是速度更慢、人工与设备成本更高,也更难达到流水线每小时处理大量书页的效率。
马斯克的表态为行业提供了一个可检验标准:如果一家拥有数十亿美元预算的AI公司认为珍本保护值得承担额外成本,其他实验室就很难再把“只能切掉书脊”描述为技术必然。
不过,这目前仍是马斯克的公开指示,而不是已经公布的SpaceXAI采购规范、第三方审计或保存项目。后续需要观察团队如何识别珍本、是否对全部旧书设置筛查程序、数字副本是否向图书馆或公众开放,以及供应商是否真正放弃破坏性扫描。
最尖锐的问题:公共知识被毁掉实体载体后,数字副本却留在私人模型里
普通图书馆数字化的目标通常是保存、检索和扩大公共访问。AI训练数据项目则可能走向相反方向:实体书被销毁,数字全文进入公司内部图书馆,最终被压缩进无法逐页检索、无法准确引用来源、也不向公众开放的模型权重。
这使“数字保存”变成了一个值得质疑的说法。保存不仅意味着信息曾被扫描,还意味着未来的人能够确认版本、研究纸张与装订、检查边注、追溯来源,并在模型输出错误时回到原始证据。一本书的文化价值也不只等于OCR得到的文字。
AI公司当然可以合法购买二手书,很多普通旧书也并不具有馆藏价值。但当采购规模达到数百万册,企业就不能继续把每一本书都当作可替换耗材。最低限度的行业规则应包括珍本筛查、馆藏查重、无损优先、销毁记录、向保存机构转交高风险书籍,以及让数字化成果承担一定的公共保存责任。
AI需要人类积累数百年的文字才能变得更聪明。真正荒诞的结局,是它学会谈论历史之后,人类却发现承载那些历史的原件已经被当作训练成本处理掉了。
资料来源:HedgieMarkets原始贴文、埃隆·马斯克回应、Bartz et al. v. Anthropic PBC法院裁定、The Next Web关于旧书训练数据供应链的报道、德国Tagesschau对欧洲旧书商的调查。本文将法院已确认事实、媒体调查和书商风险判断分别表述。

TopsTip