一名Anthropic员工在内部聊天中回复:“zlibrary my beloved”。如今,这句对盗版电子书库的亲昵表达,被Sony Music Publishing、Warner Chappell Music及关联出版公司写进了针对Anthropic的版权诉讼。
诉状于2026年8月28日提交至美国加州北区联邦法院,被告包括Anthropic、CEO Dario Amodei和联合创始人Benjamin Mann。出版商指控,这家公司通过BT下载、网页抓取和其他数据集取得受版权保护的歌词与乐谱,再用于Claude的开发;他们要求法院颁布禁令,并对故意侵权按每部作品最高15万美元主张法定赔偿。金额只是法律上限,作品数量和责任都尚未由法院确定。
这宗案子最值得关注的,并不是一句聊天记录有多难看,而是它把AI版权争议拆成了三个不同问题:材料如何取得、是否进入商业模型、模型输出是否构成侵权。三者需要分别举证。
七百万本书与一条仍待证明的训练链
诉状称,Mann在2021年6月通过BitTorrent从LibGen下载约500万本书;2022年7月,Anthropic又从PiLiMi下载至少200万本不与LibGen重复的书。出版商引用此前Bartz图书版权案披露的材料称,一名创始人在PiLiMi镜像出现时告诉同事它来得“正是时候”,随后有人回复“zlibrary my beloved”。
原告认为,这段交流说明Anthropic清楚数据来自盗版书库。诉状还称,相关文件中包含数百首或更多受版权保护作品的歌词、歌本和乐谱,列举了《Livin’ On a Prayer》《September》《Hallelujah》等作品;对训练输入和输出的更广泛指控则涉及数万首作品。这里的“数百”与“数万”对应不同证据范围,不能合并成一个已经确认的数字。
Anthropic公开否认把从LibGen和PiLiMi下载的书用于商业Claude模型训练。出版商因此提出一条更间接的路径:至少一个商业Claude模型可能使用了由非商业模型生成的合成数据,或接受了后者提供的强化反馈,而那个非商业模型接触过盗版书库文本。诉状还指控Claude能够逐字或近似输出受保护歌词。
这条链条如果成立,出版商就能尝试把早期数据取得、后续模型训练和面向用户的输出连接起来;如果无法成立,员工聊天最多证明团队对数据来源的态度,不能自动证明每一部涉案作品被用于商业Claude。接下来的证据开示将决定原告能否拿出模型版本、数据流转和输出测试之间的对应关系。
为什么音乐出版商此时追进来
Anthropic此前已用15亿美元解决作者针对盗版图书的集体诉讼。新案把同一批书库中的歌词和乐谱单独拎出,也加入网页抓取、版权管理信息被移除以及Claude输出等主张。一本歌集可能同时承载文字、乐谱和多个权利人的作品,同一份训练材料因此可能引出不同权利链条。
这也解释了为什么此前关于图书训练的裁定不能直接替Anthropic结束争议。训练是否构成合理使用,与公司是否有权通过盗版渠道取得并长期保存原始文件,并非同一个法律问题;音乐案还要处理歌词许可市场和模型输出是否成为替代品。
Anthropic表示不同意出版商的主张,并将积极抗辩。现阶段可以确认的是新诉讼、下载规模、被引用的内部聊天和原告提出的侵权路径;尚不能确认的是数万首作品究竟有多少进入了哪些商业Claude版本,以及AI生成内容给词曲作者造成了多少可归因损失。诉讼的分水岭不会是一句尴尬的聊天,而是一条能否被逐步验证的数据链。

TopsTip