人类花了几个世纪写出来的书,正在被AI公司以每分钟几十本的速度拆掉。不是读,是拆。切掉书脊,送进高速工业扫描仪,变成数字文件,然后碎掉。
2026年7月,调查媒体404 Media的一则深度报道揭开了AI行业一个隐秘的产业链:多家AI公司正通过中间商大规模收购二手图书,扫描内容后直接销毁实体书,只为获取”未被机器碰过”的训练数据。这场被称为”AI焚书”的事件迅速引爆全球舆论,连马斯克都看不下去了。
一、旧书收购潮:从一本到一百万本
据404 Media报道,一家名为ISBNdb的数据中间商正成为AI公司采购旧书的核心渠道。这家原本服务于图书馆和书商的平台,如今在官网上赫然写着:”全世界最好的AI训练数据,正躺在书架上。”
订单规模惊人。单次采购从1000本到100万本不等,且买家身份被严格保密。一位职业书商向媒体透露,今年4月以来他的销量从每周约20本飙升至数百本,是平时的五倍。这些采购行为有几个异常特征:只收带有ISBN编号的图书,完全没有主题或作者偏好,更重要的是——买家似乎完全不在意价格。
二、”巴拿马计划”:200万本书的消失
这场”焚书”行动的核心主角是AI公司Anthropic。法庭文件显示,该公司于2024年初启动代号为”巴拿马计划”的秘密项目,内部文件直言:”巴拿马计划是指我们破坏性扫描世界上所有书籍……我们不希望外界知道我们在做这件事。”
操作流程堪称工业级:采用液压切割机直接切除书脊,将散页送入高速工业扫描仪,完成数字化后直接将纸质原件粉碎或打成纸浆。据披露,Anthropic累计销毁约200万册实体书,涵盖学术专著、冷门史料、地方志,甚至可能包括存世极少的绝版书籍。
三、AI为何要”焚书”?答案指向模型塌缩
很多人不理解:互联网上的数据不是用不完吗?AI公司为什么要花数千万美元去买旧书,再把它们毁掉?
答案指向一个AI公司自己制造的问题——模型塌缩。斯坦福大学2026年AI指数报告显示,自2025年初以来,新发布的互联网内容中AI生成的比例已超过一半(51.72%)。当AI模型用AI生成的内容继续训练,每一代模型的质量都会比上一代更差,就像复印机不断复印复印件。牛津大学和剑桥大学的研究登上《Nature》封面:用AI输入一段关于14世纪教堂塔楼的文本,到第九代输出时,模型开始热情洋溢地介绍各种不存在的兔子物种。
而2022年之前出版的纸质书,从时间线上就天然免疫了AI污染,成为最后的”纯净语料”。
四、合法但不合理:15亿美元的天价和解
更令人意外的是,这种做法在美国被联邦法院裁定为合法。
2025年6月,北加州联邦法院法官裁定:合法购买纸质书后进行破坏性扫描并数字化,用于AI训练属于”合理使用”,因为销毁原件确保了”同一时间只存在一份副本”。
但Anthropic的麻烦并没有结束。法院同时查明,该公司在启动”巴拿马计划”之前,曾从盗版网站下载并长期保存了超过700万本电子书。2026年7月,联邦法院正式批准了15亿美元(约合101亿元人民币)的和解协议,原告方律师称这是”已知最大规模的版权赔偿”。
一个荒诞的悖论就此形成:合法买书销毁,合法;上网下载盗版,非法。法院实际上鼓励了”买书销毁”的模式——若保留原件或公开分享,法律地位反而更弱。
五、知识私有化与文化不可逆
这场旧书争夺战揭露了一个更深层的危机:知识正在从公共资产变为私有黑箱。
扫描后的数字内容全部进入AI公司的私有数据库,仅用于训练其模型,公众无法访问。批评者担忧,在批量采购中,AI公司是否会区分普通图书与绝版珍本?如果稀有书籍被拆毁,它们可能永久退出流通。一位书商告诉媒体,他的库存里有很多不常见的、绝版的书籍,”其中一些被销毁的,真的就是目前流通的最后几本了”。
六、马斯克看不下去了,但行业难题待解
事件曝光后,马斯克在社交平台X上公开表态,已要求旗下SpaceX AI团队对珍稀书籍采用无损扫描方式,”以费力但完整的方式扫描它们,而不是简单地切断书脊”,并将原件保存在图书馆。
这一表态获得广泛认同,但行业面临的根本问题仍未解决:当旧书也被耗尽,当二手书店的货架空空如也,AI将不得不吞下自己制造的毒药——用AI生成的内容继续训练AI,陷入恶性循环。
写在最后:
AI公司一边高喊”造福人类”,一边为了训练AI永久销毁了人类的文化遗产。那些被切碎的书页里,可能有你再也读不到的文字。而AI学会了如何像人一样说话,代价是人类失去了一部分自己说过的话。
当AI把人类写在纸上的最后一句话也吞进去之后,互联网上剩下的,就只有AI自己说过的话了。
关于文章版权的声明:
https://news.softunis.com/66256.html 文章来自软盟资讯
若非本站原创的文章,特别作如下声明:
本文刊载所有内容仅供提供信息交流和业务探讨而非提供法律建议目的使用,不代表任何监管机构的立场和观点。不承担任何由于内容的合法性及真实性所引起的争议和法律责任。
凡注明为其他媒体来源的信息,均为转载,版权归版权所有人所有。
如有未注明作者及出处的文章和资料等素材,请版权所有者联系我们,我们将及时补上或者删除,共同建设自媒体信息平台,感谢你的支持!

