Anthropic本月宣布,其Claude系列大语言模型生成的文本和文件将被添加水印,以便让用户识别AI生成的内容。此举旨在帮助该公司遵守欧盟关于AI生成内容透明度的相关法规。
欧盟《AI生成内容透明度行为准则》要求提供和部署AI系统的企业告知用户其正在与AI交互,并在AI内容中添加水印。此外,消费者还必须了解自己是否接触到了深度伪造内容以及情绪识别、生物特征分类工具。欧盟委员会表示,已有近200家机构同意遵守上述规定。
AI内容水印与起源于13世纪意大利的传统水印技术完全不同。AI系统可以自动在文本中嵌入标记,表明内容来自AI而非人类。常见方式包括调整词间距、数字格式、词语顺序及其他隐形信号,这些标记即便在内容被复制粘贴到不同平台后依然保留。读者无法察觉这些标记,但计算机系统可以识别。
Anthropic表示,2025年8月2日及之后发布的Claude模型均将包含水印功能,涵盖通过API、Claude、Claude Code、Claude Cowork和Claude Tag创建的内容。无论Claude在哪里提供服务,水印功能都将适用于所有Claude生成的内容,不限于欧盟地区。Anthropic还表示,将"很快"公布用户如何检测文本是否由AI生成的详细信息。
AI透明度正成为行业趋势。Substack与Pangram合作,让读者了解文章中AI生成内容的比例;Suno近期也宣布推出相关功能,帮助听众判断歌曲是否由AI创作;LinkedIn用户可举报疑似AI生成的内容;Spotify的新功能AI Persona则允许听众和创作者了解哪些音乐是用AI制作的。
在技术层面,Claude模型生成的文本可通过词语的选择方式加以识别。当文本量足够大时,AI检测工具能够发现只有Claude模型才会使用的特定模式。Anthropic表示,文本水印不会降低内容质量,读者在不使用AI检测工具的情况下无法区分有水印和无水印的文本。"在内部测试中,我们没有发现水印对Claude文本内容、创意水平或可读性产生任何影响。"
Anthropic表示,其工具基于谷歌用于检测文本、图像、视频和音频中AI内容的SynthID系统。SynthID在文本中的检测原理已发表于2024年的《自然》期刊。
Claude添加的文本水印在内容被复制粘贴到记事本等文本编辑器后依然保留,甚至经过人工编辑也可能无法完全消除。"水印将在模型层面应用,这意味着无论文本来自哪个Claude产品或平台,水印都会存在。"
在文件水印方面,Claude会在.png、.jpg、.svg等格式文件的元数据中附加经过加密签名的注释,说明文件是由Claude生成或处理的。这是图像编辑软件和相机制造商用于记录图像来源的C2PA标准规范的组成部分。若有人试图篡改这一信息以隐瞒AI生成事实,加密签名将会损坏,从而向读者表明内容曾遭篡改。
Anthropic在公告中也说明了水印的局限性:存在水印不代表内容一定由Claude生成,不存在水印也不代表Claude未参与其中。例如,若有人将他人文章输入Claude要求改写,输出内容将带有水印,但内容的事实和细节来自原作者而非AI。若有人将Claude生成的内容与其他文本混合编辑,即使只有一小部分来自Claude,也可能带有水印。"轻度编辑可能无法完全去除水印,但将每个词都替换掉的完全改写可以。"
此外,Claude生成或处理的内容也可能因AI生成比例过小,或经过大量编辑、改写、翻译、混合等操作而不带水印。如果有人对图像进行截图并另存为新文件,元数据也将随之丢失。"水印只能说明Claude可能在某个环节参与了内容创作,无法区分'Claude撰写了此内容'和'Claude对此内容进行了大量编辑'。"
值得注意的是,尽管Anthropic努力遵守欧盟规定,但有报告指出AI检测的准确性并不可靠,例如非英语母语者创作的内容常被误判为AI生成。Anthropic表示,Claude的水印流程不会泄露使用者的任何个人信息、所属机构或与Claude的对话内容。
此次公告在Claude用户中引发了强烈反弹。据Business Insider报道,部分用户已取消付费订阅,并在X平台上发帖批评这一决定。不少用户担心,即便文章中只有少量Claude生成的文字,也会被标记为AI内容,成为影响内容可信度的"红字"。
内容完整性平台Copyleaks首席执行官阿隆·亚明在一份声明中表示,AI水印存在过高的误报风险,且无法让读者了解究竟有多少文本真正由AI生成。"水印是二元的,如果有人写了一篇极具原创性的文章,只是借助AI工具润色了语法或结构,水印就会将整篇文档标记为100%由AI生成。这惩罚了现代工作方式,完全忽视了人类原创思维的价值。"亚明还指出,claudewatermark.com、claudewatermarks.com和StealthGPT等网站已开始宣传如何去除Claude水印。
Q&A
Q1:Claude的AI水印是如何工作的,能去掉吗?
A:Claude的文本水印通过调整词语选择方式嵌入内容,读者无法察觉,但AI检测工具可以识别。水印在复制粘贴后依然保留,轻度人工编辑也可能无法消除。只有将每个词都替换掉的完全改写才能去除水印。文件水印则通过C2PA标准在元数据中附加加密签名,截图另存会导致元数据丢失,但篡改签名本身会留下被篡改的痕迹。
Q2:Claude水印会暴露用户的个人信息吗?
A:不会。Anthropic明确表示,Claude的水印流程不会泄露任何使用者的个人信息、所属机构或与Claude的对话内容,水印仅用于标识内容与Claude存在关联,不涉及用户隐私数据。
Q3:有水印就代表内容全部由AI生成吗?
A:不一定。Anthropic指出,水印只能说明Claude可能在某个环节参与了内容创作,无法区分"Claude完整撰写"和"Claude仅做了编辑润色"。例如,用Claude改写他人文章或仅用于润色语法,输出内容都会带有水印,但原始内容实际来自人类。反之,不存在水印也不代表Claude完全未参与。
