随着美国联邦法院解封版权诉讼卷宗、《华盛顿邮报》《404 Media》深度调查曝光,真相浮出水面:以开发 Claude 大模型的 Anthropic 为首的 AI 企业,启动代号巴拿马计划(Project Panama),在全球批量收购纸质图书,工业化扫描数字化后彻底销毁实体原书,仅留存电子副本用于大模型训练。数百万承载人类文字记忆的书籍化为纸浆,这场被业内称为 “现代数字化焚书” 的操作,依托美国版权判例实现 “合法合规”,背后藏着 AI 产业的数据焦虑、资本逐利逻辑与人类文明传承的深层矛盾。
巴拿马计划曝光后,媒体查证 Meta 等头部 AI 企业内部邮件,明确提出 “获取海量纸质图书库是维持 AI 竞争力的核心筹码”。大量数据中间商顺势兴起,ISBNdb 曾公开推出专项服务,主打为 LLM 大模型批量供应旧书,承诺为客户提供全套采购凭证、销毁认证文件,并签署严格保密协议隐藏 AI 企业买家身份;直至舆论发酵后,该业务页面才紧急下架。
二、核心疑问:为什么只收 2022 年前的旧书?语料界的 “低本底钢”
AI 企业不惜重金全球扫货老书,根源是行业无法回避的模型坍塌(Model Collapse) 技术危机。
斯坦福《2026 AI 指数报告》统计,2025 年初起,互联网上新产出内容中 AI 生成文本占比突破 51.72%,全网充斥低质量、重复、失真的机器创作内容。大模型若持续投喂 AI 自产文本迭代训练,如同反复复印复印件,错误、冗余信息不断累积,会出现语义退化、逻辑失真、创造力枯竭,最终模型能力持续下滑,也就是 “模型坍塌”。
2022 年是生成式 AI 大规模普及的分水岭,2022 年前正式出版的纸质图书,是唯一完全由人类原创、未被机器文本污染的大规模文字资源,业内将其类比为精密探测仪器必备的 “低本底钢”:
1945 年人类首次核试验后,大气遍布人工放射性物质,二战前沉船钢材未受辐射污染,成为稀缺工业原料;对应到 AI 训练,2022 年前的书籍,就是无 AI 污染的纯净原生语料库。
同时,图书天然具备互联网碎片化内容无法比拟的优势:经过编辑、作者、校对多层打磨,逻辑完整、知识密度高、行文严谨,而非社交平台碎片化闲聊、自媒体流水账。使用图书语料训练,能大幅提升 AI 文案、法律文书、专业报告、学术写作的质量,帮助 AI 更好替代白领、营销、律师、程序员等岗位,直接兑现商业化收益。
三、最争议操作:扫描后必须销毁原书,一套钻法律空子的版权逻辑
大众最大困惑:既然只是需要文字内容,为何不能扫描后留存实体书籍,非要粉碎销毁?答案藏在美国版权法 “首次销售原则” 与 2025 年版权诉讼判例,也是 AI 企业规避巨额赔偿的核心手段。
绝版孤本永久消失,唯一载体只剩企业私有电子库
大量小语种文献、地方史料、私人手稿、小众绝版书本身存世量极少,经 AI 企业收购销毁后,全球不再留存纸质实体。唯一完整备份掌握在商业 AI 公司私有数据库中,普通研究者、图书馆、大众再无接触渠道;电子文件可随时篡改、删除,相比纸质书籍不具备永久留存、多方核验的可靠性。
纯净人类语料持续枯竭,人为制造数据垄断
2022 年前无 AI 污染的图书是不可再生资源,随着持续销毁,优质原生训练数据总量只会不断缩减。未来 AI 行业算力、算法逐步趋同,企业核心竞争力将绑定独家稀缺纸质图书数字化语料。行业存在灰色猜想:企业主动销毁实体书,人为抬高自有电子数据库的稀缺价值,如同打碎一对古董花瓶中的一只,让剩余单品溢价暴涨,形成数据资源垄断。
本末倒置:AI 依靠人类文明迭代,却反向消耗文明载体
大模型诞生的初衷是复用、传承人类知识,但当下商业逻辑完全倒置:为优化 AI 营销文案、办公自动化等商业功能,不惜批量摧毁不可再生的文字遗产。马斯克曾公开批评巴拿马计划是现代焚书行为,并要求旗下 SpaceX AI 采用无损扫描、完整留存原版书籍,形成鲜明对比36氪。