2026年8月28日,索尼、EMI、华纳查普尔三家音乐出版商向法院提交起诉书(Sony v. Anthropic),指控 Anthropic 大规模盗版受版权保护的音乐作品——乐谱与歌词——用于训练其 Claude 模型,并要求法院责令 Anthropic 披露训练数据的完整来源。
这是 Anthropic 在版权领域遭遇的第二波诉讼。此前公司已承认盗版超过 700 万本书训练 AI,并在 2026 年 7 月与文字作者群体达成 15 亿美元和解。出版商在起诉书中明确表示:15 亿美元不足以威慑一家估值约 2 万亿美元的公司。
盗版链条:从 LibGen 到 PiLiMi
起诉书称,Anthropic 的盗版行为始于 2021 年 7 月。联合创始人 Benjamin Mann 亲自使用 BitTorrent 从盗版书库 Library Genesis(LibGen)下载了数百万本盗版书,首席执行官 Dario Amodei 批准了这一行为,两人均被列为被告。
LibGen 被 FBI 关停后,其内容被复制为 Z-Library,随后又出现镜像站 Pirate Library Mirror(PiLiMi)。员工内部聊天记录显示,Mann 曾催促同事尽快下载 PiLiMi 镜像,一名员工回复「zlibrary my beloved」。出版商认为,这些聊天记录证明 Anthropic 主动依赖盗版渠道获取训练数据。
合成数据链路:商用模型被指间接使用盗版内容
Anthropic 否认使用盗版书籍训练商用 Claude 模型。但出版商指出,「训练」的定义是关键:AI 开发通常包含预训练阶段,一个模型会用另一个模型生成的合成数据训练,或接收其强化反馈。
出版商指控,Anthropic 至少有一个商用 Claude 模型使用了非商用模型产生的合成数据,而该非商用模型本身是用 LibGen 和 PiLiMi 文本训练的;Anthropic 还利用盗版书籍数据测试输出与原文的相似度。这些指控若成立,商用模型与盗版数据之间就存在一条间接但完整的链路。
AI 歌曲挤占市场:版权局的判断
出版商认为,音乐行业与图书行业的关键差异在于市场损害更容易证明。美国版权局已观察到:即使生成式 AI 的输出与特定作品不完全相似,只要它在该类作品的市场中竞争,就可能稀释版税池。
诉讼还列举了 Claude 的具体行为:被提示时输出受版权保护的歌词、用户未要求时也生成歌词、将真实歌词与 AI 生成歌词混搭成「新歌」、能够再现热门作品的核心部分。而这些行为发生时,模型并未附带版权管理信息。
Anthropic 的回应:合理使用抗辩
Anthropic 发言人称,这是「同一批律师提起的第三起诉讼,翻用已在法院审理中的指控」,并表示「训练生成式 AI 模型属于变革性合理使用——正如 Bartz 案判决所认定的那样」。
但出版商反驳:Bartz 案中作者未能证明市场损害,而音乐行业的情况不同——AI 生成的歌曲已经登上音乐排行榜,直接与词曲作者竞争。Amodei 曾在作者诉讼中作证,Anthropic 本可以合法购买版权作品,却选择了盗版,理由是避免「法律、实践与业务上的麻烦」。
这场诉讼的关键看点
整起诉讼的胜负手在于:音乐出版商能否证明 AI 训练对词曲作者市场造成了实际损害。若能证明,判决将直接改变 AI 公司获取训练数据的方式;若不能,Anthropic 的合理使用抗辩将继续占优。
无论结果如何,训练数据透明度已经成为 AI 公司无法回避的问题。出版商要求法院责令 Anthropic 提供训练数据、训练方法与模型能力的完整账目——这一要求若获支持,将把 AI 训练数据的来源首次置于司法审查之下。