全球顶尖音乐出版商认为,Anthropic此前在一项历史性和解中支付的赔偿远远不够。此前,Claude的开发商承认盗取逾700万册书籍用于AI训练,最终赔付15亿美元。

"15亿美元的和解金额显然不足以对一家公司的侵权行为形成震慑——该公司正是凭借这种大规模侵权行为,积累起高达2万亿美元的估值。"音乐出版商在上周五提起的诉讼中如此表示。

提起诉讼的音乐出版商包括索尼、EMI和华纳·查普尔。他们指控Anthropic的非法种子下载行为还涉及"数以万计"包含歌词和乐谱的书籍,涵盖数百首乃至更多受版权保护的音乐作品。

诉状指出,在音乐排行榜上日益要与AI生成作品竞争的词曲作者,正因这种盗版行为受到直接伤害。

据称,Anthropic计划"永久"保留的盗版书籍中,包括披头士全集、泰勒·斯威夫特"最佳"歌曲精选,以及《VH1百大摇滚金曲》等。出版商指控,若法院不颁布禁令叫停这种不当的AI训练行为,Anthropic将持续侵犯音乐版权——不仅逐字复制歌词,还会生成新歌曲来模仿热门作品的"灵魂",从而不正当地取代艺术家在市场中的地位。举例来说,Anthropic可能利用歌曲集或乐谱来响应用户提示,要求Claude将Eminem的歌词改写成"碧昂丝风格"的歌曲。

"这是一场肆无忌惮的大规模非法种子下载、爬取和抓取受版权保护作品的行动,目的是为了开发和运营AI系统,并从中攫取巨额利润。"音乐出版商在诉状中写道。

Anthropic的"大规模非法种子下载行动"始于2021年7月,彼时Anthropic联合创始人本杰明·曼亲自使用BitTorrent,从有争议的盗版图书馆"创世纪图书馆"(LibGen)非法下载并上传了数百万册盗版书籍。诉状还指名Anthropic联合创始人兼CEO达里奥·阿莫代伊批准了上述种子下载行为,两人均被列为被告。

然而到2021年底,FBI关闭了LibGen。诉状指出,"但在此之前,网络盗版者已将其内容复制,并建立了一个新的图书馆,名为'Z-Library'。"尽管Z-Library随后也迅速遭到关闭,但在图书作者的维权诉讼中曝光的内部消息显示,Anthropic通过"盗版图书馆镜像"(PiLiMi)获取了这份副本的复制版本。

曼被指控在PiLiMi上线后不久,便指示员工下载该镜像,并在内部消息中写道,这个镜像出现得"正是时候!"对此,一名Anthropic员工回复道:"zlibrary my beloved(Z图书馆,我的挚爱)。"

音乐出版商援引上述言论,作为Anthropic推崇盗版行为、并依赖种子下载快速获取训练数据的证据。他们总计指控,通过检索LibGen和PiLiMi的非保密目录,发现"书目元数据,包括书名、作者和ISBN",表明"Anthropic至少种子下载了数百册含有乐谱和歌词的书籍",这些书籍均涉及原告出版商所拥有的版权音乐作品。

出版商在诉状中表示,将通过证据开示程序披露Anthropic种子下载行为的"全部范围"。

对此,出版商承认Anthropic否认将任何从LibGen和PiLiMi种子下载的书籍用于训练商业版Claude大语言模型。但他们认为,Anthropic的表述取决于对"训练"的定义。他们认为,如果法院追溯Anthropic的操作路径足够深入,或许会发现商业模型在某个阶段确实基于盗版作品进行了训练。正如诉状所解释的:

"AI开发通常包括一个'预训练'阶段,在此阶段,一个AI模型可能基于另一个AI模型生成的'合成数据'进行训练,或从另一个AI模型获得行为反馈。Anthropic至少使用了一个非商业AI模型所生成的合成数据,来训练其对外发布的Claude商业模型——而该非商业模型是基于源自LibGen和/或PiLiMi的文本训练而成的。Anthropic还使用了至少一个基于LibGen和/或PiLiMi文本训练的非商业模型,为至少一个商业版Claude模型提供强化反馈。"

此外,诉状还指出,图书作者案近期解封的文件"揭示了Anthropic将非法下载的盗版书籍用于其内容审核机制"。例如,在一份文件中,Anthropic的一名证人作证称,Anthropic已停止使用LibGen数据集训练大语言模型,但仍继续使用该数据集来检测模型输出内容是否与原始文本存在过长的字符串匹配。

Q&A

Q1:音乐出版商为何认为15亿美元的和解金不够?

A:音乐出版商认为,Anthropic凭借大规模盗版行为积累了高达2万亿美元的估值,15亿美元的赔偿根本无法对其形成有效震慑。他们在诉状中明确指出,这一金额不足以遏制未来的侵权行为,因此提起新的诉讼,要求法院颁布禁令,叫停Anthropic继续利用盗版作品训练AI模型。

Q2:Anthropic内部员工的"zlibrary my beloved"聊天记录说明了什么?

A:这条内部聊天记录出现在Anthropic联合创始人本杰明·曼指示员工下载盗版图书馆镜像PiLiMi之后,员工的回复表明团队对使用盗版资源持欢迎甚至推崇的态度。音乐出版商将其作为关键证据,用以证明Anthropic主观上认可并依赖盗版手段快速获取AI训练数据,而非仅仅是技术上的疏忽。

Q3:Anthropic否认侵权,为何出版商仍认为商业版Claude涉及盗版训练?

A:Anthropic声称其商业版Claude模型未直接使用盗版书籍训练,但出版商指出,AI开发存在"预训练"阶段——商业模型可能基于另一个非商业模型生成的合成数据进行训练,而那个非商业模型恰恰是用LibGen或PiLiMi的内容训练出来的。出版商认为,追溯完整的训练链条,盗版内容实际上间接影响了商业模型。

ArsTechnica - AI