Anthropic近日宣布,将对旗下所有模型处理过的内容(不仅限于生成内容)添加水印。在一篇支持文章中,Anthropic解释称,此举是为了遵守欧盟《AI法案》的相关要求——该法案要求所有AI系统提供商对AI生成或经AI处理的音频、图像、文本及视频输出添加水印。该法律适用于2024年8月2日后发布的所有AI模型,并为此前发布的模型设置了宽限期,要求提供商在2026年12月前完成更新。
Anthropic确认,未来在全球范围内推出的所有新模型(而非仅限欧盟地区)均将从发布第一天起对AI生成内容进行标记。文本输出将"嵌入水印",对用户不可见;其他生成文件则将"在支持的情况下包含经数字签名的来源元数据"。
值得注意的是,Anthropic采取了一种"一刀切"的激进做法——在所有支持水印的处理内容上均予以标记,尽管欧盟法规明确豁免了AI系统执行"辅助性标准编辑"(如语法纠错)或"未实质性改变"用户文本内容或含义的情形。
由于水印是在模型层面应用的,无法区分内容究竟是全新生成还是仅做了细微修改(如添加了一个逗号),因此Claude有可能对那些原本无需标记的内容也打上水印。在Anthropic推出可供测试的检测工具之前,其水印标记的实际覆盖范围尚无法验证。该公司表示,未来将公布水印检测方法,以满足欧盟法律对技术支持的相关要求。
Anthropic还指出,水印功能在"部分平台或功能"上暂不支持。对于非文本内容,Anthropic将采用C2PA元数据方式记录内容来源信息。
然而,欧盟所提倡、Anthropic所实施的这一做法,对于恶意行为者而言极易绕过,却可能让那些信任系统标注的普通用户受到不公正的影响。文本水印的工作原理是在整篇文档中对模型的词语选择进行有规律地偏置,只有借助专用工具进行整体分析才能检测到。但问题在于,"不可见"也意味着模型有时会用一个略逊的词替换最佳用词,只为维持水印信号的完整性。
Anthropic指出,这些水印"在文本被复制粘贴到其他地方时仍会保留,并可能在经过部分编辑后依然存在"。但如果含水印的文本被粘贴到另一个会对其进行修改的聊天机器人系统中,水印可能就会遭到破坏。对于图像和视频内容,截图、录屏或使用任何主流的元数据编辑工具,同样足以抹去这些信息。而一旦Anthropic公布水印的识别方式,构建一套用于去除水印的工具也将轻而易举。
此外,这一机制被误读的可能性相当高——水印本身所传达的信息相当有限。Anthropic解释称,"检测到水印只是说明该内容曾经过Claude处理,但并不具有完全确定性。"水印实际传达的信息仅为"该内容可能经过Claude处理",甚至有可能出现在并非由Claude生成的内容上。
更令人担忧的是,普通公众往往难以区分"经AI处理的文本"与"完全由AI生成的文本"之间的差异。如果一段由人类撰写的文字仅仅因为在工作流程中经过Claude的编辑就被打上水印,那么它将与完全由AI生成的内容被同等对待。而这一切都发生在这样一个系统之下——正如Anthropic所说,"未检测到水印,并不意味着该内容没有经过AI生成或处理"。
Q&A
Q1:Anthropic为什么要给Claude处理的内容添加水印?
A:Anthropic此举主要是为了遵守欧盟《AI法案》的要求。该法案规定,所有AI系统提供商必须对AI生成或处理的音频、图像、文本和视频输出添加水印。Anthropic决定将这一措施推广至全球所有新模型,而不仅限于欧盟地区,所有新模型从发布第一天起就会对相关内容进行标记。
Q2:Claude的水印能被去除或绕过吗?
A:相对容易。文本水印通过偏置模型词语选择来实现,若含水印文本被粘贴到其他会修改文本的系统中,水印可能会被破坏。对于图像和视频内容,截图、录屏或使用元数据编辑工具即可去除水印信息。一旦Anthropic公布水印识别方法,构建专门的去除工具也将十分简单。
Q3:Claude的水印检测到了说明什么?没有水印就代表内容不是AI生成的吗?
A:水印检测到仅代表"该内容可能经过Claude处理",并不完全确定,甚至可能出现在非Claude生成的内容上。而没有检测到水印,也并不意味着内容没有经过AI生成或处理。因此,这套水印系统的准确性和可靠性存在较大局限,可能对用户造成误导。
