索尼和环球音乐集团(UMG)再次对AI音乐生成公司Suno提起诉讼。两大唱片公司指控该公司的新版v6模型仍然侵犯其版权,原因是该模型是基于用户在使用先前版本模型时产生的输出内容进行训练的,而那些先前版本本身是利用从YouTube等来源抓取的未经授权音乐训练而成。值得注意的是,索尼和UMG是尚未与Suno签署授权协议的主要唱片公司。

在提交给The Verge的诉状中,索尼和UMG指控Suno进行了"模型洗白"操作,诉状写道:

"用一个侵权模型的输出内容来训练'新'模型,并不能消除侵权行为;这只是在进行洗白——将原告作品中蕴含的价值,从被复制的录音转移到受污染的模型中,再从这些模型转移到其输出内容中,最终又转移到v6模型中……v6并非一个全新的起点,而是同一棵毒树结出的果实。"

在v6模型发布时,Suno的杰克·布罗迪曾告诉The Verge,该模型是"从零开始训练的,使用了一套全新的数据",其中包括"用户数据",但未透露更多细节。Suno后来向Engadget证实,这些数据包括用户的"创作内容",但在被要求置评时拒绝进一步说明。

索尼进一步指控,Suno在训练v6模型时使用了"蒸馏"技术。诉状称,v6被训练用于复制此前"教师"模型的输出结果,而这些教师模型正是利用侵权数据创建的。

诉状指出,"即便某个模型没有直接使用原告的录音进行训练,它仍然受到Suno所保留的未经授权副本的影响,并从中获益。"本质上,两大唱片公司认为,除非Suno真正做到从零开始训练,否则其模型将持续建立在被盗数据的基础之上。

Q&A

Q1:索尼和UMG为什么再次起诉Suno?

A:因为它们认为Suno的新版v6模型虽然号称是全新训练的,但实际上是基于用户使用先前侵权模型产生的输出内容训练而成,而先前的模型使用了从YouTube等平台抓取的未经授权音乐,所以v6仍然存在侵权问题。

Q2:什么是"模型洗白"?

A:"模型洗白"是指用一个已经存在版权侵权问题的旧模型所产生的输出内容,去训练一个"新"模型,试图以此掩盖或切断与最初侵权数据的关联,但实际上侵权价值仍然通过这种方式被转移和保留下来。

Q3:Suno官方对训练数据来源是如何回应的?

A:Suno的杰克·布罗迪表示v6模型是"从零开始训练的,使用了一套全新的数据",包括"用户数据"。公司后来向媒体确认这些数据包含用户的"创作内容",但没有透露更详细的信息。

The Verge