扩散模型的复杂程度已经足够高,即便无法访问原始图像,它们也能重新生成出该图像。
麻省理工学院计算机科学与人工智能实验室(CSAIL)的研究人员设计了一系列假设场景,通过替换不同的训练数据集,测试在原始图像数据被完全移除后,模型输出结果会发生怎样的变化。
结果发现,当模型规模足够大时,输出内容毫无变化。
研究人员将这一现象称为"归因衰减":扩散模型训练的数据越多、模型规模越大,单一输入数据对输出结果的影响就越小。
"如果移除某条数据后,模型的输出没有任何改变,那就说明这条数据根本没有影响输出结果。"该研究的第一作者戴峥在麻省理工学院的一篇博客文章中解释道。
这一发现对于解决知识产权(IP)和版权侵权方面日益增长的争议,可能产生深远影响。
现代生成式扩散模型本质上是通过复制大型训练数据集中的统计规律,来生成逼真的内容。研究人员指出,这些强大的工具在图像、视频和音频生成等众多应用领域已取得"卓越成果"。
然而,这些模型正日益受到创作者、企业和政策制定者的审视,各方都希望找到一种方式,来界定谁应为生成内容承担责任。围绕这些模型,世界各地已出现多起诉讼、版权许可谈判以及拟议中的法规。
例如,Stability AI(Stable Diffusion的开发商)和Midjourney目前正深陷一场集体诉讼之中。多名艺术家在加利福尼亚州联邦法院提起诉讼,指控这些热门的图像、视频和音频生成模型在未经授权的情况下,抓取了数十亿张受版权保护的图像。
Getty Images也曾对Stability AI提起诉讼,但英格兰和威尔士高等法院商业和产权法院驳回了相关主张,不过Getty在商标权方面部分胜诉,原因是部分AI生成图像与其作品高度相似。
麻省理工学院CSAIL的研究人员指出,归因能力的提升将有助于深化对"机器遗忘"、数据投毒、模型互操作性、公平性和隐私保护等问题的理解,同时也有助于解决伦理、法律、财务和监管层面的挑战。
研究人员写道:"开发一种能够将生成内容追溯至关键训练数据的方法,将极大地推动我们对这些模型的理解,并提升对其进行监管的能力。"
在实验中,研究人员采用了消融法——即通过移除某些元素来测试其影响,具体做法是观察模型在从未"见过"某张图像的情况下会生成什么内容。
消融法通常较难实施,因为移除数据后需要重新训练模型。但麻省理工学院CSAIL的研究人员将这一方法应用于"扩散集成"架构,该架构由多个组件组成,各组件分别在不同数据子集上训练。通过替换这些组件,研究人员可以判断每个组件对输出结果的影响程度。
"我们的分析基于观察在省略部分训练集后,模型行为是否发生变化。"研究人员解释道。
为此,他们训练了24个集成模型,所用数据集的图像数量从256张到逾16万张不等。这些图像来自七个公开图像数据集,包括ArtBench(艺术作品)、CIFAR-10(通用彩色图像)、Fashion-MNIST(服装与配饰)、CelebA(名人面孔)和MetFaces(人脸图像)。
在一个示例中,研究人员展示了一幅由模型生成的著名油画,该模型的训练数据来自744位艺术家的公共领域作品。即便将特定艺术家的数据从训练集中完全删除,该模型仍能生成数百张看似相同的图像,并与原图并排展示。
原始作品被以各种可能的形式重新呈现。研究人员通过量化在省略训练数据后所能引发的最大变化,来衡量归因程度——随着数据集规模扩大,这一变化范围不断缩小,无论是按像素比较还是按语义内容比较,结论均一致。
换言之,即便将特定艺术家的单件作品或特定人物的照片从数据集中完全删除,模型仍能重现该图像或该风格。研究人员解释称,随着规模扩大,具体关联将逐渐消失,将生成内容追溯到特定数据点在实践中几乎"不可能实现",乃至完全无法实现。
研究人员表示,该方法的创新之处在于:此前的研究主要聚焦于大规模移除数据,而非针对单一数据点的"留一法归因"。
这一实验表明,正如戴峥所言,将某一生成内容归因于某一具体数据"意义不大",创作者等群体可能无法提供追溯至其原始作品的审计链。
共同作者、麻省理工学院教授兼CSAIL首席研究员大卫·吉福德表示,这些发现与模型输出是否构成衍生作品这一法律核心问题直接相关。
"一种理解方式是:这些模型具有创造性,"他说,"它们并非简单地复制输入内容,而是在创造全新的输出。"
吉福德表示,如果输出内容无法与单一训练数据相关联,那么关于合理使用的争议将随之而来,甚至可能引发讨论:模型生成的内容本身是否能作为"新颖作品"受到版权保护。
这也可能改变原创者的版税讨论方向——当模型输出看似直接再现了某人的作品,却无法追溯到互联网上任何具体来源时,原创者该如何获得补偿?
吉福德最终表示,确保输出内容不可归因,应是"行业的责任,而非可利用的漏洞"。AI开发者"需要改进模型,充分利用这一研究的成果,从而证明自己并非在创作对特定个人或作品的衍生内容"。
Q&A
Q1:"归因衰减"是什么意思?
A:归因衰减是麻省理工学院CSAIL研究人员提出的概念,指扩散模型训练数据量越大、模型规模越大,单一数据对输出结果的影响就越小,甚至完全消失。即将某张图像从训练集中删除后,模型仍能生成相同或高度相似的内容,导致生成内容无法追溯到具体训练数据。
Q2:这项研究对AI版权诉讼有什么影响?
A:该研究表明,随着模型规模扩大,将AI生成内容追溯至具体训练数据在技术上几乎不可能实现。这意味着艺术家或版权方很难提供证据,证明模型输出直接源自其受保护的作品,从而影响版权侵权诉讼的走向。同时也引发新问题:模型生成的内容本身是否构成"新颖作品"并受版权保护。
Q3:麻省理工学院CSAIL研究人员用什么方法做的实验?
A:研究人员采用消融法,基于"扩散集成"架构,训练了24个集成模型,数据集规模从256张到逾16万张图像不等,涵盖ArtBench、CIFAR-10等七个公开数据集。通过替换不同训练组件,观察移除特定数据后模型输出是否发生变化,从而量化单一数据的归因程度。
