“巴拿马计划”不是焚书阴谋,争议在训练数据如何获得
“巴拿马计划”确有其事,但它不是多个AI巨头共同秘密销毁全球图书的计划。美国诉讼中公开的内部材料显示,这是Anthropic为建设训练资料库实施的图书数字化项目。公司批量购买纸质书,切除书脊后用高速设备扫描,再丢弃或回收纸张,以获得供内部使用的数字文本。
破坏性扫描的目的主要是提高速度和降低成本,并不等于消灭书中知识。现有材料也没有证明Anthropic试图买断世上每一本书,更没有证据表明被处理的都是孤本或珍本。内部文件中“扫描全世界所有书籍”的表述体现项目野心,不能按字面解释为清除公共图书馆或控制人类全部知识。
真正复杂的是版权边界。美国联邦法官认为,把依法购买的纸质书转换为内部数字副本,并在转换后不再保留原书,可以构成合理使用;但Anthropic此前从影子图书馆下载数百万本盗版电子书,法院并未认可这种取得方式。后续高额和解针对的重点也是盗版来源,而非所有模型训练行为。
这场争议仍提出了三个具体问题:大规模收购会不会减少稀缺版本的公共存量,作者能否从训练用途获得合理补偿,私人资料库是否应接受透明度和保存标准约束。把问题说成AI即将“焚书坑儒”过于夸张,却也不能因此忽视数据来源、文化保存与企业权力之间真实存在的冲突。
