大语言模型正在给文本加水印,你能发现吗?AI文本水印通常难以察觉,但并非总是如此。

8月11日,Anthropic宣布,未来所有Claude模型生成的文本都将包含一种水印,用于标识其结果为AI生成。这家公司并非孤例。谷歌也有自己的文本水印技术(Anthropic的水印正是基于此),并将其应用于Gemini模型的输出中。OpenAI尚未推出文本水印,但计划这样做。

水印技术的快速普及,部分原因是对欧盟《人工智能法案》的回应。该法案要求2026年8月2日后发布的AI模型必须带有水印,此外还有其他一些拟定和正在提议的法规,旨在遏制欺骗性或操纵性AI生成内容的传播。但这些新规可能会让那些只想获得最佳效果的AI用户付出一定代价。

AI水印可以应用于多种形式的内容:欧盟《人工智能法案》同样要求图像、音频和视频加水印。这类媒体水印已经使用多年,尽管作为标记AI内容的整体解决方案,其有效性仍存在争议,但它们的检测率可以达到99%以上。OpenAI、谷歌、Meta等公司已经部署了图像和视频水印。(Anthropic不提供图像生成模型。)

然而,文本水印的部署频率相对较低,并非所有人都相信文本水印能够在不影响AI模型回答质量的前提下发挥作用。资深科技作家、Markdown语言的共同创造者John Gruber将水印称为"对写作的扭曲",并反驳了Anthropic的说法,即水印不会改变文本的含义或质量。他指出,图像由数百万个像素组成,而文本回答通常只有几十或几百个词。文本似乎提供的空间要小得多,很难在可检测但又不破坏内容的情况下改变AI输出。

Vector研究所的博士后研究员John Kirchenbauer持不同看法,他也是2023年一篇论文的合著者,该论文首次描述了一种文本水印方法。"如果没有变化,水印就无法被检测到。这是一个非常基本的观点,"他说。"问题在于,如果这不影响你的实际使用体验,你会在意它是否偏离了原始分布吗?"

现实中,问题的核心归结为"实用性"这个词。给AI生成的文本加水印,是否会实质性地降低使用者的体验?这个答案仍存在争议。

AI文本水印的工作原理

"水印"这个词已经足够熟悉,以至于当它应用于AI时,反而容易让人对其工作原理产生误解。文本水印并不是元数据或不可见字符,而是某种更微妙的东西。具体细节因方法而异,但通常来说,如果没有用于检测特定水印的密钥,人类(在许多情况下甚至是计算机)都无法察觉文本水印的存在。要理解原因,需要先了解大语言模型的工作方式。

大语言模型在响应提示的每一步中,都会为可能出现的下一个词生成一个概率。(接下来,我将"词"和"Token"互换使用,尽管Token也可以代表数字、标点符号等。)一个可能出现的词或许有40%的概率,一个合理的替代词有10%的概率,而一个不太可能出现的词只有零点几个百分点的概率。模型随后会根据这些概率权重随机选取一个词。概率最高的词通常会被选中,但并非总是如此。

"如果没有变化,水印就无法被检测到。这是一个非常基本的观点。"——John Kirchenbauer,Vector研究所

这个过程为隐藏文本水印提供了机会,可以通过对词语选择方式进行细微调整来实现。

Kirchenbauer及其同事在2023年发表的论文提供了实现文本水印的最早范例之一,至今仍是被引用最多的技术。研究人员描述了一种水印方法,将词语分为"红名单"和"绿名单"。红名单中的词不做改动,而绿名单中的词的出现概率会被略微提高。

"如果我们从这个调整后的分布中采样,那么虽然任何单个词的选择未必来自我们偏好的那个集合,但经过多次采样后,我们会倾向于从那个被提高权重的子集中选词,"Kirchenbauer说。

文本水印嵌入在词语选择之中,这正是它对人类几乎不可见的原因。Kirchenbauer及其同事报告称,在包含约200个Token的回答中,检测率达到98.4%,且没有出现误报。这种嵌入式的词语概率模式也意味着简单的改写无法掩盖水印。该论文指出,要去除一段长文本回答中的水印,需要修改大约四分之一或更多的词语。

水印会降低AI文本质量吗?

尽管AI文本水印的设计初衷是让人类读者无法察觉,但从定义上讲,它确实会影响AI生成文本中的词语模式。正是这种算法层面的干预,让像Gruber这样的批评者担心水印会降低输出内容的整体质量。

支持"文本水印不影响质量"这一观点的最有力证据,来自谷歌团队2024年发表的一篇论文,该论文介绍了谷歌名为SynthID-Text的水印方案。Anthropic的水印同样基于SynthID-Text,尽管Anthropic并未详细说明具体做了哪些改动。

为了证明SynthID-Text水印不影响质量,谷歌的作者们将Gemini用户的查询随机分配给带水印和不带水印的文本模型版本。然后,他们比较了整体的用户反馈。作者们发现,在2000万条回答中,用户反馈没有出现显著差异。

尽管如此,一些研究人员仍然对水印方法不影响AI生成回答质量的说法持怀疑态度。他们的怀疑源于一些让水印实现变得更加困难的边缘情况。

Meta的AI研究科学家Vinu Sankar Sadasivan是一篇被广泛引用的关于AI文本水印可检测性论文的合著者,他表示,当潜在词语选择数量较少时,水印尤其难以发挥作用。"对于一条20个词的推文,我需要让50%到60%的词来自'绿名单',才能让水印被良好检测到,"他说。AI生成的一段基础Python函数代码也会在水印强度和模型回答质量之间产生类似的矛盾。

"这正是我与Anthropic某些公关文章观点不一致的地方,他们说水印不会带来质量变化,"Sadasivan说。他解释说,可以动态调整水印强度以在困难情况下保持回答质量,但这样做也会降低水印的强度。谷歌的SynthID-Text论文中就包含了一个例子,图中绘制了检测率与回答中Token数量的关系。在最佳情况下,检测率最高可达95%,但对于较短的回答,检测率会降至50%以下。

由于Anthropic没有提供更多信息,很难判断该公司在AI回答质量和水印强度之间是如何权衡的。Anthropic拒绝为本文提供更多信息。

AI文本水印的权衡之争

关于AI文本水印的争议,不仅在于其效果如何,还在于为了给AI生成文本贴上清晰标签,怎样的权衡才算合理。Gruber的立场是,改变文本内容是不可接受的,因为这会让AI模型的输出与原本应有的样子不同。而另一方面,欧盟《人工智能法案》则暗示,只要能让人们知道自己正在阅读AI生成的文本,一定程度的改动是可以接受的。

"对于一条20个词的推文,我需要让50%到60%的词来自'绿名单',才能让水印被良好检测到。"——Vinu Sankar Sadasivan,Meta

更为复杂的是,AI研究人员越来越关注将文本水印用于标记单个AI生成文本以外的其他目的。尤其是,水印可以用来大规模追踪数据。

Kirchenbauer在2026年合著的一篇论文表明,一个在带水印文本上训练的AI模型,本身也会生成带有该水印的输出。因此,一位在发布文档之前先给文档加了水印的内容所有者,可以利用这些痕迹作为统计证据,证明自己的文本最终被用于某个模型的训练数据中。

另外,一家正在训练新模型的AI公司,也可以利用文本水印将前几代模型生成的内容排除在训练数据之外。这种防护措施有助于避免模型崩溃,即AI模型不断循环并放大自身的错误。

在Kirchenbauer看来,这些更广泛的考量正在改变整个关于文本水印的讨论方向。"这不再仅仅是关于'你使用了AI'这种指控,而是正在转向数据溯源、模型循环利用等方面,"他说。"我认为你可以把文本水印当作一种通用的元数据来使用,某种程度上更可靠,某种程度上也可能不那么可靠,它可以附加在内容上,让你追踪内容的流向。"

Q&A

Q1:AI文本水印是什么?它是如何工作的?

A:AI文本水印不是元数据或隐藏字符,而是通过调整大语言模型生成词语时的概率分布来实现的。模型会将词语分为不同类别,并略微提高某些词语被选中的概率,通过大量文本中的这种细微模式来实现水印识别,而人类读者通常无法察觉这种变化。

Q2:AI文本水印会不会降低AI生成内容的质量?

A:这个问题目前仍存在争议。谷歌的一项研究通过2000万条真实用户反馈发现,带水印和不带水印的回答质量没有显著差异。但也有研究者指出,在较短文本或词语选择空间有限的场景下,水印强度和内容质量之间需要权衡,可能会影响实际效果。

Q3:哪些公司已经在使用AI文本水印技术?

A:谷歌已经在Gemini模型中使用名为SynthID-Text的水印技术,Anthropic的Claude模型水印也是基于此开发的。OpenAI目前尚未推出文本水印,但已表示计划引入。这一趋势部分是为了应对欧盟《人工智能法案》中关于AI内容标识的相关要求。

Spectrum