Anthropic于周二发布了Claude Fable 5.1,该模型在生成文本中嵌入了统计特征,但开发者不应期望这种特征会在模型生成的所有内容中同等显著地出现。

代码是Anthropic水印系统局限性最明显的领域之一。该系统并非通过添加元数据或隐藏字符来实现水印,而是改变Claude在选择下一个Token时所使用的随机性,Anthropic表示这种方式不会影响输出的质量或内容。

在足够长的回复中,这些Token选择会形成一种统计模式,可以提供证据表明Claude很可能参与了文本的编写或处理。这种方法在自然语言场景下效果更好,因为模型通常有多种方式表达同一含义;但在代码场景中,选择不同的变量、运算符或函数可能会改变程序的行为,甚至导致程序出错。因此,当某个特定Token对准确性至关重要时,Anthropic不会对其应用水印。

开发者还需要适应Claude处理保留思维(preserved thinking)方式的变化。在Fable 5.1中,Anthropic限制了新API账户将这些思维块(thinking blocks)延续到修改后对话中的方式,该公司表示这种做法此前也曾被用于大规模蒸馏其模型。

在足够长的回复中,这些Token选择会形成一种统计模式,可以提供证据表明Claude很可能参与了文本的编写或处理。

水印的工作原理

Anthropic于8月14日详细说明了其满足相关要求的计划,此前该公司作为约190家签署方之一,签署了欧盟《AI生成内容透明度实践准则》。该公司表示,由于没有可靠的方式按地区限制水印的应用,因此将在全球范围内应用该技术,并计划在未来几个月内将其添加到旧版Claude模型中。

该技术基于谷歌DeepMind的SynthID-Text。它不会改变Claude为下一个Token分配的概率,而是改变在多个可选项中进行选择时所涉及的随机性。在足够长的回复中,这些选择会留下一种统计模式,日后可以用正确的密钥进行检测。

由于水印是文本本身的一部分,而非作为元数据附加,因此简单地将回复复制到其他地方并不会移除水印。

由于水印是文本本身的一部分,而非作为元数据附加,因此简单地将回复复制到其他地方并不会移除水印。Anthropic表示,该水印甚至可以在一定程度的编辑后存留下来,不过如果对文本进行足够多的重写,最终仍会消除这种信号。

代码的低熵问题

代码是水印局限性表现得更为明显的领域。如果选择不同的Token可能导致答案错误或使代码出错,Anthropic就不会应用水印。水印仍可能出现在约束较少的输出部分,例如代码注释中,而较短的回复可能不包含足够的信号以被可靠检测到。

Anthropic正开始通过一个处于私密预览阶段的API提供这种检测功能。目前,访问权限仅限于符合条件的群体,包括监管机构、执法部门、媒体机构、事实核查人员和研究人员,以及出于自身AI法案合规需求的企业。Anthropic表示计划在未来更广泛地开放该API的访问权限。

思维块与模型蒸馏

Fable 5.1中的另一项变化针对模型蒸馏问题。Claude的Messages API可以返回加密的思维块,开发者可以在后续对话轮次中将其传回,使模型能够在整个对话过程中延续其推理过程。

据Anthropic表示,问题在于:如果在保留这些思维块的同时更改了对话的早期部分,可能会导致Claude解密并输出其推理内容。而这些推理内容随后可能被用于训练另一个模型。

在Fable 5.1中,Anthropic通过将保留的思维与产生该思维的上下文绑定,来堵住这一漏洞。该限制适用于2025年8月31日及之后在Claude平台、亚马逊Bedrock、谷歌云Vertex AI以及微软Azure Foundry上创建的新账户。

现有账户目前仍可在不受此限制的情况下使用Fable 5.1,但Anthropic表示,未来的模型发布将对所有用户应用该限制。

智能体框架面临权衡

这一限制给正在构建自有智能体框架的开发者带来了一个不太明显的问题。智能体系统不一定会在每次模型调用之间保持上下文静态不变。一个智能体框架可能会在任务执行过程中删除旧的对话内容、总结早期历史记录,或重新组织对话结构。这些都是常见的上下文管理技术,但它们也会改变与思维块相关联的上下文。

Anthropic表示,开发者应保持思维块不变,并确保之前的系统提示、工具定义和消息内容逐字节保持不变。如果应用程序会修改这些上下文,就需要改变管理Claude推理状态的方式,而不能继续沿用同样的思维块。

预计只有少数使用自定义集成的客户会受到影响,现有的Fable 5.1 API客户将获得一段时间进行调整,之后该限制才会在未来模型中成为标准做法。

这两项变化解决的是不同的问题,但二者都在不完全限制开发者使用Claude构建产品的灵活性的前提下,增加了相应的保护措施。

这两项变化解决的是不同的问题,但二者都在不完全限制开发者使用Claude构建产品的灵活性的前提下,增加了相应的保护措施。

Q&A

Q1:Claude Fable 5.1的水印技术是如何实现的?

A:该水印技术并非添加元数据或隐藏字符,而是通过改变Claude选择下一个Token时的随机性来实现。这种方式基于谷歌DeepMind的SynthID-Text技术,在足够长的文本中会留下可被检测的统计模式,且这种水印不会被简单复制文本的方式移除。

Q2:为什么Claude Fable 5.1的水印在代码中效果较差?

A:因为代码对Token选择的容错性很低,选择不同的变量、运算符或函数可能会导致程序出错或行为改变。因此当某个Token对准确性至关重要时,Anthropic不会对其应用水印,只有注释等约束较少的部分才可能包含水印信号。

Q3:Claude Fable 5.1对思维块的限制会影响哪些开发者?

A:该限制主要影响构建自定义智能体框架的开发者,尤其是那些会删除旧对话、总结历史记录或重组对话结构的应用。这类应用需要调整管理Claude推理状态的方式,而不能继续沿用同样的思维块,预计仅有少数使用自定义集成的客户会受到影响。

The New Stack