铭鸿体育资讯网

这都21世纪了,居然还发生“焚书”!AI巨头们为了抢干净的训练数据,开始疯抢古董

这都21世纪了,居然还发生“焚书”!AI巨头们为了抢干净的训练数据,开始疯抢古董孤本书,扫描后直接搅碎!问题是,这里面可能有绝版古籍呀。

2026年7月,调查媒体404 Media的一篇报道揭开了这个秘密。多家AI公司正在通过中间商大规模收购2022年以前出版的实体书。这些书被送入工厂,用液压切割机切除书脊,单页送入高速工业扫描仪。内容被提取后,实体书被直接粉碎销毁。

其中,AI公司Anthropic的行动规模最大。它启动了内部代号“巴拿马计划”的项目,投入数百万美元购买大量实体书,用于训练其AI大模型Claude。据披露,仅Anthropic一家就销毁了约200万本实体书。

这些书籍的来源,包括Better World Books等二手书商。服务商ISBNdb被曝协助完成了最高达百万册的订单,并保持买家匿名。这意味着,很多人捐赠或卖掉的二手书,很可能已经变成了一堆纸浆。

为什么要“焚书”?答案很残酷,最根本的原因就是为了竞争!

2022年底ChatGPT爆火后,互联网上充斥着大量AI生成的内容。如果用这些“二手数据”训练新模型,会导致模型质量下降。因此,2022年以前出版的、未受AI“污染”的书籍,成了大模型训练最稀缺、最宝贵的高质量语料。越是年代久远、越冷门稀缺的书,价值越高。

如果AI公司只是扫描,然后把书完好无损地还回去或卖掉,这些实体书可能再次流入市场,成为其他AI公司的训练数据。销毁实体书,等于物理上切断了数据“二次流通”的可能,防止竞争对手获得同样的“干净”数据。

更让人没想到的是,AI公司这么做,居然是美国法院“促成”的。

2025年,北加州联邦地方法院法官William Alsup在一份判例中裁定:合法购买的纸质书,如果一对一转为数字馆藏、销毁纸本、且不对外散布,这道格式转换可算“合理使用”。2026年,在针对Anthropic的版权诉讼中,法院再次认定,将正版图书用于AI训练属于版权法下的“合理使用”。

但法院同时认定,Anthropic曾长期保存一个包含700万本盗版图书的数据库,侵犯了作者和出版商版权。为此,Anthropic被判赔偿高达15亿美元。这个逻辑好理解:合法购买并销毁来训练AI,可以免责;非法爬取并永久囤积,必须重罚。

但问题是,为了获取高质量数据,牺牲实体书的物理存在,代价是不是太大了?

AI公司用“焚书”来获取“干净”数据,目的是发展AI,这无可厚非。扫描后粉碎书籍,既解决了版权问题,也变相将知识保存下来。在如今实体书供应充足的情况下,这种做法对存量书籍的影响,至少目前还在可控范围内。

但问题在于,这种“破坏性扫描”如果只是针对普通流通书籍尚可承受;一旦涉及存世量极少的绝版古籍、孤本,就触及了文化保护的底线。希望AI公司充分考虑这一点,别让技术进步,成为文明传承的代价。

不得不说,历史总是充满讽刺。古时候,焚书是为了消灭思想;现在,焚书是为了把思想存进AI的数据库。只是不知道,这一回,是好还是坏。