Anthropic“巴拿马项目”销毁百万实体书训练Claude,1.5亿美元和解案文件曝光

Anthropic通过“巴拿马项目”购买并销毁数百万实体书以训练Claude模型,内部文件显示公司试图保密此举。作者起诉后公司以15亿美元和解,法庭解封文件揭示其利用首次销售原则规避版权成本,引发科技界对数据获取方式的讨论。

Anthropic的“巴拿马项目”涉及购买数百万本二手实体书,经扫描后销毁原书,用于训练Claude模型。法庭记录显示,该项目在2024年内部规划文件中被描述为需保密,文件称“我们不想让外界知道我们在做这件事”。

事实还原

根据华盛顿邮报报道的解封文件,Anthropic在2021年先从LibGen下载数字书籍,后转向实体书。项目使用液压切割机切除书脊,再以高速扫描仪数字化页面,最后由回收公司处理残书。2025年8月,公司与作者集体诉讼达成15亿美元和解,法官认定此举符合转换性使用,属于合理使用范畴。

这些操作依托首次销售原则,允许买家处置所购实体书而不受版权人干预。文件显示,Anthropic视实体书为“必要”数据源,用以避免模型输出“低质量互联网语言”。

机制拆解

商业逻辑上,实体书获取成本低于授权许可,且通过物理销毁可减少额外复制指控。技术层面,切割与高速扫描实现规模化处理,内部文件提到计划扩展至“世界上所有书籍”。此方式既满足训练需求,又试图在法律灰色地带操作。

公司早期依赖盗版数字库,后转向合法购买实体书,显示对数据来源合规性的逐步调整。解封文件揭示领导层将书籍内容视为提升模型写作质量的关键。

产业影响

对竞争对手而言,此事件可能促使其他AI公司重新评估数据采购策略,避免类似法律风险。上下游出版商和作者群体获得和解补偿,但未来授权谈判可能更趋谨慎。

开发者与企业用户面临训练数据获取成本上升的可能性,若类似实践受限,依赖公开或授权数据的模型迭代速度或受影响。

对照与先例

与早期AI公司从网络抓取数据相比,Anthropic转向物理书销毁体现了规模扩大后的策略转变。历史中首次销售原则曾支持二手书市场,此案将其延伸至AI训练领域,法官认定未产生额外物理副本或再分发。

战略判断

基于现有文件,此案可能引发更多AI公司调整数据策略。事件凸显AI训练对高质量文本的依赖与版权边界的冲突,未来数据获取或更多转向授权渠道。