Anthropic于周五发布了一篇博客文章,就其旗下聊天机器人Claude的文本水印机制回答了若干基本问题:水印究竟如何运作?经过编辑后水印是否会消失?水印对代码又会产生怎样的影响?

自Anthropic本周早些时候宣布将通过水印技术遵守欧盟《AI法案》透明度规范以来,Claude用户之间的争论从未停止。该规范要求AI公司部署相应系统,以便识别AI生成的内容。

在Reddit上,有用户将此举定性为"针对无辜Claude用户的阴谋",也有人反驳称:"唯一不想要这个功能的理由,就是想欺骗别人。"据Business Insider报道,已有"数十名"X平台用户声称因此取消了Claude订阅。

Anthropic的新文章首先对水印概念进行了概述。文章解释道,当Claude在做"低风险选择"时——例如在用"阴云密布"还是"灰蒙蒙"来描述天气之间做选择——它可以在回复中形成一种特定规律,"读者无法察觉,但持有编码密钥的人可以检测到"。

"水印不会影响Claude的输出质量,"该公司表示,"对于读者而言,带水印的回复与不带水印的回复毫无区别。"

在技术细节上,Anthropic表示将采用谷歌DeepMind团队于2024年提出的SynthID-Text方案,并计划发布水印检测API。Anthropic还特别指出,水印技术与Pangram等公司提供的AI检测方式有本质区别——后者通过识别写作中的"特征标志"(例如"这不是X,而是Y"这类句式结构)来判断是否使用了AI。"识别这些规律与检测水印,在本质上是两种不同的方法。"

针对"通过改写来抹除水印"的疑虑,Anthropic表示这种情况确实存在,但"轻度编辑可能不会完全消除水印",而"完全重写、逐字替换则可以"。

"在后一种情况下,这段文字是否还能被称为'AI生成内容',本身就值得商榷,"该公司补充道。

对于仅经过Claude校对或润色的文本,Anthropic表示是否会携带水印取决于"文本长度以及Claude的编辑程度"。如果只是轻度润色,"几乎所有文字"仍出自人类作者之手,"几乎没有(甚至完全没有)供水印附着的空间"。

在代码方面,由于模型需要生成可运行的代码,没有太多空间在同等有效的选项之间自由选择,因此代码中的水印痕迹会比其他文本少。

"话虽如此,在代码中某些词语或术语存在任意选择空间的地方,水印仍可发挥作用,例如代码中的注释部分,"Anthropic表示,"但从定义上讲,水印对实际生成的代码影响微乎其微。"

Anthropic还表示,Claude不会是唯一生成带水印文本的AI聊天机器人,因为"其他主要模型开发商也签署了同一份行为准则,并将实施各自的水印方案"。

Q&A

Q1:Claude的文本水印技术是如何运作的?

A:Claude在生成文本时,会在措辞选择等"低风险决策"环节中嵌入特定规律,这种规律对普通读者不可见,但持有对应密钥的人可以检测出来。Anthropic采用的是谷歌DeepMind于2024年提出的SynthID-Text方案,并计划发布专用的水印检测API。整个过程不会影响文本质量,带水印的回复与不带水印的回复对读者而言没有任何区别。

Q2:对Claude的回复进行编辑或改写,能消除水印吗?

A:轻度编辑通常无法完全去除水印,但如果对全文进行逐字替换式的彻底重写,水印则会消失。对于仅经Claude校对润色的文本,是否含有水印取决于文本长度和Claude的编辑程度——如果只是轻微润色,文本主体仍由人类撰写,水印几乎无从附着。

Q3:Claude的水印对代码有什么影响?

A:代码中的水印痕迹比普通文本少,因为生成可运行代码需要遵循严格的语法规则,模型没有太多空间在同等有效的选项之间自由选择。水印可能出现在代码注释等存在任意选词空间的地方,但对实际生成的功能性代码影响微乎其微。

TechCrunch - AI