Anthropic 15亿美元和解获批:AI训练数据进入“来源审计”时代

摘要:美国加州北区联邦地区法院最终批准 Anthropic 与作者、出版商之间总额 15 亿美元的版权集体诉讼和解。这并不等于法院宣告训练大模型必须付费,而是对盗版语料来源开出巨额账单。

这不是法院宣告“训练大模型必须付费”,而是一张为盗版语料来源开出的巨额账单。

美国加州北区联邦地区法院于7月20日最终批准了 Anthropic 与作者、出版商之间总额15亿美元的版权集体诉讼和解。和解范围涉及482,460部作品,截至今年4月已有440,490部作品被权利人认领,占总数的91.3%。法院估算,每部作品对应的赔偿约为3,000美元,实际分配还需扣除律师费和管理成本。法官同时将原告律师申请的1.875亿美元费用压低至约1.016亿美元,认为直接按和解总额比例收费会给律师带来过高回报。

从金额看,这是美国版权集体诉讼中规模最大的一次和解。但这起案件最容易被误读的地方,也恰恰在这里:Anthropic 支付15亿美元,并不等于法院已经认定“使用受版权保护的书籍训练 AI 本身违法”。

2025年6月,时任主审法官 William Alsup 曾经把 Anthropic 对书籍的使用拆成三个不同环节。第一,使用书籍训练 Claude 及其前代模型,被认定为具有高度转化性,属于美国版权法中的合理使用。第二,购买纸质书后将其扫描为数字副本,只要不增加副本数量、不重新传播,也被认定为合理使用。第三,从 LibGen、PiLiMi 等盗版资源中下载书籍,并将其长期保存在一个可供内部人员使用的通用数字图书馆中,则没有得到合理使用保护。

换句话说,法院区分了两个经常被混为一谈的问题:

模型拿这些书做了什么,以及公司最初是怎样拿到这些书的。

训练用途可能具有转化性,并不意味着企业因此获得了从盗版网站免费获取原始材料的权利。此前裁决还明确表示,Anthropic 后来购买部分书籍的正版副本,可能影响最终赔偿数额,但不能自动消除最初通过盗版渠道取得作品所产生的责任。

最终和解的边界也值得注意。它主要解决作品清单中相关书籍被下载、复制和用作历史输入材料所产生的索赔,并不自动覆盖 Claude 过去生成的具体输出,也没有免除 Anthropic 在2025年8月25日以后行为可能产生的新责任。Anthropic 否认存在不当行为,并强调此前裁决已经支持将书籍用于模型训练属于合理使用。

因此,这起案件真正改变行业的地方,可能不是给所有训练语料统一标价,而是迫使模型公司开始认真回答一个长期被忽略的问题:

每一份进入训练管线的数据,究竟从哪里来?

一家模型公司可能拥有先进的算法和强大的算力,却因为无法证明训练材料的来源、授权状态和流转过程,背上数十亿美元的潜在负债。数据不再只是训练系统里的“燃料”,也开始成为需要登记来源、许可条件、访问记录和保存期限的法律资产。

这意味着大模型的数据治理可能逐渐接近金融机构管理资金,或者制药公司管理临床试验材料的方式。企业需要保存更完整的数据来源记录,区分公开网页、购买内容、授权数据库与未知来源文件,追踪哪些材料进入了哪些训练批次,并建立删除、隔离和争议处理机制。

对数据市场而言,这也可能抬高“权利干净”语料库的价值。拥有明确合同、版权元数据和可追溯来源的出版档案、专业数据库与授权内容,过去可能被认为价格太高,如今却可以帮助模型公司避免更大的诉讼风险。合成数据、公共领域作品和直接向创作者采购内容,也可能因此获得更高的战略地位。

不过,这起案件仍然没有回答所有 AI 版权问题。它没有建立一套全行业通用的训练许可制度,也没有认定所有模型公司都必须按书籍、网页或者 token 向权利人付费。2025年的裁决来自联邦地区法院,其他法院仍可能在不同事实和证据下得出不同结论;此次和解本身也不是对所有争议进行终审判决。

Anthropic 的15亿美元账单所传递的最清晰信号是:在 AI 时代,“训练用途是否合理”与“训练材料取得是否合法”是两本不同的账。

模型公司可以继续围绕合理使用展开法律辩论,但已经很难再把数据来源当作一个无关紧要的工程细节。下一阶段的大模型竞争,除了参数、算力和产品体验,还将多出一项过去很少被放在发布会上讨论的能力:证明自己的数据是怎么来的。

分享到