---
title: "AI 公司买走绝版古书，扫描完就销毁"
description: "Anthropic 大量收购 2022 年前出版的绝版旧书，扫描后销毁原件：既为获取未被 AI 污染的纯净语料以避免模型坍缩，也是法院认定合理使用的合规路径。"
date: 2026-08-03T04:00:00Z
canonical: https://xiaobox.github.io/p/2026-08-03-ai-gong-si-mai-zou-jue-ban-gu-shu-sao-miao-wan-jiu-xiao-hui/
author: 小盒子
categories: ["AI"]
tags: ["Claude"]
license: CC BY-NC-SA 4.0
license_url: https://creativecommons.org/licenses/by-nc-sa/4.0/
---

# AI 公司买走绝版古书，扫描完就销毁


故事是这样的。

澳洲有一家二手书店，老板是个普通得不能再普通的旧书商。最近他收到一批奇怪的订单，全是市面上找不到的绝版老书，还点名只要 2022 年以前出版的。

一次几十本，隔三差五来一单。

老板一开始还挺高兴，大客户啊。后来慢慢觉得不对劲，收货地址写着 Anthropic，就是做 Claude 那家 AI 公司。

![](https://xiaobox-public-images.oss-cn-beijing.aliyuncs.com/images/%E7%BB%9D%E7%89%88%E5%8F%A4%E4%B9%A6-%E4%BA%8C%E6%89%8B%E4%B9%A6%E5%BA%97%E5%A5%87%E6%80%AA%E8%AE%A2%E5%8D%95.png)

这批书的命运，比绝版更惨。

它们不是被收藏，也不是被翻印，而是被送进高速机器，切断书脊，飞速扫完，原件销毁。

买来就是为了毁掉它。

你敢信？？？

更离谱的是，有位联邦法官裁定，AI 公司这么干，属于「合理使用」。

合法地买书，合法地毁书，合法地喂给模型。

看到这我整个人都不好了，我寻思了一下没寻思明白，一个做 AI 的公司，为什么非要毁掉实体书？书都没了，知识不就没了吗？

后来翻了翻媒体基于法庭解封文件的深度报道，才弄明白。

它们不是讨厌书，它们是怕书不干净。

Anthropic 内部管这个项目叫「巴拿马计划」，Project Panama，思路就一条，只找 2022 年以前出版的书，因为 2022 年之后的内容，可能已经被 AI 污染了。

![](https://xiaobox-public-images.oss-cn-beijing.aliyuncs.com/images/20260803191609955.png)

怎么个污染法？

2022 年后网上多了多少 AI 写的东西？营销文案、自媒体、甚至书稿，混在人类内容里，很难分辨。拿这些「被 AI 碰过」的文本去训练下一代模型，会发生一件很要命的事，模型坍缩。

说人话就是，模型学的是概率，AI 文本喂得越多，学到的就越不是人类表达，而是上一代 AI 的表达，一代传一代，像近亲繁殖，最后只会复读自己。论文管这叫 model collapse，打个不雅观的比方，AI 吃自己的排泄物，越吃越虚。

![](https://xiaobox-public-images.oss-cn-beijing.aliyuncs.com/images/%E7%BB%9D%E7%89%88%E5%8F%A4%E4%B9%A6-%E6%A8%A1%E5%9E%8B%E5%9D%8D%E7%BC%A9%E5%A4%8D%E5%8D%B0%E6%9C%BA.png)

所以 Anthropic 才要满世界搜罗 2022 年以前的书，那时候 AI 还没学会写字，书里的每个字都是人类写出来的，是「纯净」的人类知识样本。绝版的书没被数字化浪潮反复咀嚼过，最干净。

这也是为什么它们连 400 年前的宗教裁判所文件都不放过，那些记录中世纪审判异端的手稿，差点变成纸浆，就为了几页「纯净」文本。

几百年前的人写下的字，变成了喂给 AI 的饲料。

但问题又来了，买书就买书，为什么要毁掉？好好存着，扫描件不一样到手了吗？

这里面的门道，是法律团队精心设计出来的。

联邦法官 Alsup 在 Bartz v. Anthropic （Bartz v. Anthropic 是一起具有里程碑意义的 AI 版权集体诉讼案）里给的逻辑是，买了实体书再销毁，只留数字副本，这叫「一对一格式转换」，合理使用。如果书也留着、扫描件也留着，性质就变了，那叫「复制」不叫「转换」，版权风险拉满。

所以销毁不是蔑视知识，恰恰相反，是律师们算计出来的合规路径。

只有把原件毁掉，你手里的数字副本才站得住脚。

这才是整件事最细思极恐的地方，法律允许你买了书、毁了书、把知识喂给机器，全程合法，一点毛病没有。

来看看这些书是怎么销毁的吧。液压切割机切掉书脊，书变成一页页散纸，扫描仪唰唰扫完，剩下的纸和水、化学品搅成纸浆，做成卫生纸、包装纸。出版业每年都这么处理滞销书，光法国一年 1.4 亿册，Anthropic 用的是同一套工业流程。

![](https://xiaobox-public-images.oss-cn-beijing.aliyuncs.com/images/%E7%BB%9D%E7%89%88%E5%8F%A4%E4%B9%A6-%E9%94%80%E6%AF%81%E6%B5%81%E6%B0%B4%E7%BA%BF.png)

历史上不止一次有人烧过书，每一次都被钉在耻辱柱上。可这一次，没有人举火把，没有人喊口号，只有「合理使用」四个字，文明地、合法地、批量地把书变成数据。

我很难说这到底是好是坏，追求纯净数据源确实有道理。但作为爱书的人，看着一箱箱绝版书变成纸浆，心里还是很难受。

人类几千年的知识，第一次不是被收藏，而是被当作饲料喂给 AI。

更让我觉得后怕的是，2022 年这条分界线划下去，以后所有新出版的书，理论上都可能「不够纯净」了。AI 公司要训练下一代模型，只能去更古老的纸堆里翻。

我们正在亲手把自己变成化石。

也许很多年后，AI 会写出一本完美的书，没有任何人类能写出那样的文字。而它的素材，来自 2022 年以前，那些被撕碎、被扫描、被销毁的人类手稿。那时候大概没人记得，这些书曾经放在某个二手书店的架子上，等待一个真正会翻开它的人。

