关于ZAKER Skills 合作
虎嗅APP 12分钟前

数百万本书,被 Claude “阅后即焚”

本文来自微信公众号: 字母 AI ,作者:小金牙

一本厚书被推进液压切纸机,压板落下,刀片切下,书脊被干脆利落地削掉。原本连接在一起的书页变成整齐的一沓纸张。

如果没有任何解释,看到这样一段视频,你甚至可能会觉得 " 引起舒适 "、非常解压。

可如果告诉你,AI 公司正在用这套办法成批处理纸质书,其中还可能包括冷门书和绝版书,相信你八成就舒服不起来了。

为了寻找更多训练数据,AI 公司已经从公开互联网、盗版电子书,一路找到了现实世界里的纸质书。其中,2022 年以前出版的书因为没有混入 AI 生成内容,也没有经过现代数据投毒工具处理,成了难得的 " 上品 "。

那些网上搜不到、没有电子版的冷门书和绝版书,能够提供互联网抓取不到的内容,更是 " 上上品 "。

Anthropic 被曝光的 " 巴拿马计划 " 中明确说不希望外界知道。

图书数据库公司 ISBNdb 公开宣称,可以接活儿给 AI 公司找书,能从旧书店、图书馆和绝版书目录中,一次采购 1000 至 100 万本纸质书,还会通过保密协议藏住买家身份和采购书目。

AI 公司也知道这事儿 " 不好看 "。

" 巴拿马计划 "

AI 公司开始盯上纸质书,最早是从 Anthropic 惹上的一场官司里露出端倪的。

2024 年 8 月,三名作家把 Anthropic 告上法庭,指控它未经授权,用他们的作品训练 Claude。

说实话,这类争议其实从 OpenAI 搞出个 ChatGPT 开始就没停过,一点也不新鲜,类似的官司也已经有不少。

争议在于 AI 公司把整个人类互联网抓去训练模型,到底算不算侵权?作者的书进了训练集,要不要经过本人同意、支付版权费?

所以在这场官司里,纸质书一开始压根不是主角。

为了让 Claude 懂得更多、写得更好,Anthropic 先把公开互联网扫了一遍。但网页里的内容良莠不齐,因此经过作者写作、编辑筛选和出版社校对的书籍被盯上了。

最方便的办法,当然是直接找电子书。

法庭材料显示,Anthropic 曾从 Books3、LibGen 和 PiLiMi 等资源库下载超过 700 万本书。这里面相当一部分来自盗版网站。公司并没有用完就删,而是把这些文件存进一个长期保留的 " 中央图书馆 ",准备供未来的模型训练和研究继续使用。

随后,一个内部代号为 " 巴拿马计划 " 的工程启动了。这个计划简单来说就是 Anthropic 大规模购买纸质书、扫描并喂养 AI。

不过在当时,法庭真正关心的是 Anthropic 获得和使用这些内容的方式是否合法。

2025 年 6 月,法官威廉 · 阿尔萨普给出了一套对 Anthropic 相当有利的判断。

在他看来,大模型读取一本书,并不是为了向用户复述或出售这本书,而是从中学习语言、知识和表达方式,再生成新的内容。这种用途具有很强的 " 转化性 ",和人读过一本书之后获得知识、再去创作有些类似,因此可以认为在合理使用的范围内。

至于那些买来的纸质书,Anthropic 已经为每一本付过钱。公司扫描一本,就销毁对应的实体书,只在内部留下一个数字替代品,没有多制造一份拿到市场上出售的副本。法官因此认为,这部分也没有侵犯版权。

但是那 700 多万本从盗版资源库下载的电子书就说不过去了。

法官认为,训练模型可能属于合理使用,却不能反过来证明盗版获取也是合法的。你怎么用书是一回事,这本书怎么到你手里,是另一回事。

在美国法律体系中,判例的作用是巨大的,这位法官的判例为 AI 公司开了一条路,那就是 AI 公司可以学习人类写下的作品,前提是先用合法方式把作品弄到手。

所以可以看到,在去年的 Anthropic 官司里,虽然其购买纸质书并扫描的做法已经公之于众,但是法庭及大众的关注点还是更多在老生常谈的 " 用人类知识训练 AI 的法律边界 " 上。

直到今年,两篇报道接连出现,大家才突然意识到问题的严峻性。

绝版纸质书永远消失?

今年 1 月,《华盛顿邮报》从 4000 多页刚刚解封的法庭材料中,挖出了 " 巴拿马计划 " 的更多细节。

Anthropic 在一年左右的时间里花费数千万美元,买下数百万本纸质书。供应商切掉书脊,将散开的书页送进高速扫描仪,最后再把剩下的纸张交给回收公司。仅一份项目方案,就计划在半年内处理 50 万至 200 万本书。

规模已经足够惊人,Anthropic 内部文件里的两句话更要命:

" 巴拿马计划,是我们对全世界所有书籍进行破坏性扫描的行动。"

" 我们不希望外界知道我们正在做这件事。"

这两句话放在一起,整件事就很难看了。

Anthropic 向来强调 AI 安全、道德和责任,结果却在背地里启动了一项毁掉数百万本书的秘密工程。

切书原本还可以解释为一种追求效率的扫描方式," 不希望外界知道 " 则让人很难不怀疑:Anthropic 自己也清楚,这件事一旦公开,绝对说不过去。

Anthropic 到底偷偷毁了多少书?

《华盛顿邮报》没有拿到完整书目,外界也不知道这些书里有多少是随处可见的畅销书,多少已经停止再版。人们震惊于工业化切书的规模,还很难判断它究竟造成了什么具体损失。

半年后,404 Media 的一篇报道,把担忧聚焦到了绝版书身上。

报道的主角叫 ISBNdb,一家号称拥有全球最大图书数据库的公司。它在官网上向 AI 客户公开兜售纸质书采购服务,宣称一次可以采购 1000 至 100 万本书,货源覆盖旧书店、图书馆和绝版书目录。

公司甚至把保密写成了卖点:每个项目都会签署严格的保密协议,客户身份、采购策略和目标书目一概不会披露。

更讽刺的是,ISBNdb 自己也知道这门生意见不得光。它在宣传中直接提醒客户:"AI 公司毁掉 200 万本书 ",可不是什么能赢得同情的新闻标题。

还有一点很有意思,AI 公司最近尤其喜欢 2022 年以前出版的纸质书。

原因很简单:生成式 AI 爆发以后,网上混入了大量 AI 生成内容,还有人故意使用数据投毒工具干扰模型训练。相比之下,2022 年以前出版的纸质书几乎可以确定由人类写作,经过编辑、校对和出版流程,也没有被现代投毒工具处理过。

AI 公司亲手制造了越来越多的网络垃圾,最后又回头寻找没有被 AI 污染过的旧书。

这股需求已经传到了二手书市场。一名专营稀有和低流通量图书的书商告诉 404 Media,从今年 4 月开始,他每周处理的订单从 20 本左右猛增到数百本。被买走的书主题杂乱、语言不同,彼此几乎没有联系,唯一的共同点是都有 ISBN 编号。

这名书商无法确认买家就是 AI 公司,但他的库存中有不少外文书、冷门书和绝版书。

他一方面靠这些订单清掉了多年卖不出去的库存,另一方面又很不舒服:" 我不喜欢这些书最后的用途,也不喜欢那些不常见的书被打成纸浆。" 正如前文所说,AI 公司扫描纸质书的流程是很粗暴的,这让生意变好的二手书商也忍不住心疼。

从互联网到盗版电子书,再到可以批量买来的纸质书,AI 公司一直在寻找训练资源的触角向外延伸。现在,冷门书籍乃至绝版书也难以幸免。

绝版不等于孤本。目前也没有证据证明,某本书在世界上的最后一册已经被 AI 公司销毁。

外界看不到采购清单,不知道哪些公司正在买书,更不知道书被送进切割机以前,有没有人检查过它还剩多少册。

但风险是显而易见的。

极其有限的退让

2025 年的判例(至少在美国范围)已经给了 Anthropic 一定的法律保护。

法官认为 Anthropic 合法买下一本纸质书,将它扫描成数字文件,再销毁纸质原本,最终仍然只有一份副本。数字文件没有对外出售,也没有增加市场上的流通数量,相当于用一种格式替换另一种格式,因此可以构成合理使用。

按照这套逻辑,切书甚至成了证明合法的一环。原书继续留在市场上,Anthropic 手里又多出一份数字版,便可能涉及未经授权的复制;把纸质书销毁,只保留数字文件,法律风险反而更低。

康奈尔科技学院数字与信息法教授 James Grimmelmann 就认为,Anthropic 放弃盗版书库,转而购买、扫描纸质书,是一个 " 聪明的选择 ",也体现了更加克制、符合法律的做法。

毁掉纸质书这种事,对于一本印了几十万册的畅销书来说问题没有那么尖锐,少一册并不会影响其他人继续阅读和购买。

但冷门书、绝版书和带有特殊历史痕迹的版本,显然不能这样计算。

澳大利亚和新西兰古旧书商协会主席 Dawn Albinger 指出,古旧书的价值并不只在印刷出来的正文。书页上可能有亲历者留下的批注,签名、题赠和历任收藏者的信息可以证明它的流传经历,重新装订的封皮里甚至可能藏着更早的手稿。

这些信息都依附于那一本具体的书。即使书页上的文字已经完成扫描,原来的纸张、装帧和各部分之间的关系一旦被破坏,后人也无法重新检查。

也就是说,AI 公司得到了一份适合训练模型的数字文件,却可能毁掉了一件无法通过数字文件完整还原的实物。

争议扩大后,科技行业很快出现了退让。

马斯克在 X 上表示,已经要求 SpaceXAI 团队将稀有书籍保存在图书馆,并采用更麻烦的无损方式扫描,不能简单切掉书脊。他没有公布 SpaceXAI 买了多少书,也没有解释什么样的书会被归为 " 稀有 ",这次回应更像是一种态度上的站队。

ISBNdb 退让得更快。

404 Media 报道发布 9 天后,ISBNdb 删除了面向 AI 公司的纸质书采购页面,撤下有关保密采购和破坏性扫描的宣传。公司随后改口称,相关页面只是一次市场需求测试,服务从未真正上线,ISBNdb 也从未为 AI 训练购买、扫描或者出售过任何一本书。

此前还在宣传一次采购 100 万本书,遭遇舆论反弹后,整门生意突然变成了 " 一次测试 "。

这番解释能否令人信服是一回事,它至少说明,匿名帮助 AI 公司大批量采购纸质书,已经成了一项企业不愿承担的声誉风险。

不过,马斯克的一句承诺和 ISBNdb 删除几个网页,都代替不了真正的规则。

谁负责在扫描前判断一本书是否稀有?判断依据是出版年份、版本和存世数量,还是书里的签名、批注和装帧?AI 公司是否应该公开大规模采购的书目?如果某本书已经绝版,是否只能采用无损扫描,并在扫描后交给图书馆保存?

目前,这些问题都没有答案。

讽刺的是,ISBNdb 此前反复强调,2022 年以前的纸质书之所以珍贵,正是因为它们保存了没有受到 AI 污染、经过作者写作和编辑筛选的人类知识。AI 公司越承认这些内容不可替代,就越难解释为什么承载它们的实体可以被当成一次性耗材。

读览精华

读览精华

精致阅读,品味生活

订阅

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容