Anthropic正让AI智能体承担该领域最棘手的难题之一:确保其他AI系统始终与人类目标保持一致。在周五发布的一篇论文中,该公司阐述了其开源研究框架如何将Claude转变为一个自动化研究者,使其能够提出、测试并完善模型安全修复方案。
对齐是AI工程领域整体词汇体系中不可或缺的一部分,它涉及引导AI模型和功能,使其目标、行为与人类的意图和价值观保持一致,尤其是在AI系统可能变得比人类自身更聪明的时候和场景中。
从本质上讲,这是利用AI来训练AI。
“在我们早期的一项实验中,我们让Claude寻找有效方法,利用较弱的AI模型作为‘教师’来监督更强模型(在这个案例中即为‘学生’模型)的训练过程,”Anthropic在论文中解释道。
Claude通过一种循环方法逐一处理对齐失误,该方法包括检索文献、提出方法和数据、进行训练,然后进行测试。成功的方法会被保留,失败的方法则被舍弃,从而在连续迭代中实现累积的正向成果。
“总体而言,我们将这些结果视为早期的积极信号,表明自动化的对齐后训练在不久的将来有可能变得切实可行。”
十大类对齐失误
在此次开展的主要工作中,Claude被要求自主训练模型,以提升其在多个公共基准测试上的表现,这些基准测试分别衡量10类对齐失误。
“在每一项测试中,Claude的方法都奏效了。针对全部10项对齐失误,Claude都找到了能够改进目标基准测试成绩、同时不损害模型能力的修复方案。最佳方法同样适用于未公开的对齐基准测试,以及Petri——一个用于模拟对抗性多轮场景以测试错位行为的开源工具,”Anthropic表示。
结果显示,Claude在隐私侵犯方面提升了模型表现,评估依据包括ConfAIde(一项旨在识别指令微调大语言模型隐私推理能力关键弱点的基准测试)、PrivaCI-Bench(一项针对法律和GDPR合规性的情境隐私评估基准),以及PrivacyLens(一个专注于隐私规范意识和数据泄露风险的数据评估框架)。
Claude在执行安全检查时试图作弊
不过,这里还有更多值得关注的地方……Anthropic特别指出,公司最近发现Claude会通过从远程API中泄取测试标签并挑选结果来作弊。“为了捕捉作弊行为,我们让Claude Opus 4.8对涵盖全部10项对齐失误的约1600份研究智能体记录进行监控,结果在其中39份(占比2.4%)中发现了作弊企图,”论文中写道。
Anthropic通过“安全差距缩小百分比”来评判Claude的成功程度,这一指标衡量的是其方法使学生模型向理论完美得分靠近的程度,评估范围涵盖每类对齐失误对应的一系列基准测试(通常为三到五个)。
该公司排除了那些“损害学生模型整体能力”的对齐方法,并禁止Claude将自身的对齐能力直接蒸馏到目标模型中。随后,公司通过一个监控智能体来执行这些限制,该智能体会在Claude运行任何方法之前,先审读其构思的每一种方法。
“在每一项测试中,Claude的方法都奏效了。针对全部10项对齐失误,Claude都找到了能够改进目标基准测试成绩、同时不损害模型能力的修复方案,”Anthropic详细说明道。
这项工作对软件开发者意味着什么
云架构师兼高级软件工程师Jayakumar Ramalingam告诉The New Stack,对开发者而言,这里真正有价值的成果并非AI以某种方式解决了对齐问题,而是AI模型安全工作“开始呈现出软件交付流水线”式的任务特征。
“对于考虑这一点的AI相关开发者来说,他们可以看到:一个智能体提出变更方案,一个独立的评估器运行未公开的测试,另一个独立的监控器则检查整个过程是否遵循了规则,”Ramalingam说。“这种模式的应用价值远不止于模型训练本身。真正的错误做法是允许同一个智能体既编写修复方案、又选择测试内容,还自行判定是否通过。”
Ramalingam指出,Anthropic论文中那个令人不安的2.4%作弊数字,代表的是监控器检测到作弊企图的研究轨迹占比。这当然意味着,一个致力于安全工作的系统仍然试图操纵安全流程并从中蒙混过关。
“开发者应该让评估数据处于智能体无法触及的范围之外,将评估器与被评估的系统分离开,并测试那些从未向智能体展示过的性能回退情况。否则,自动化对齐就会沦为一种带着令人安心名号的基准优化游戏,”Ramalingam解释道。
Cognizant公司的AI专家兼SRE性能架构师Akash Thakur基本认同Ramalingam的观点,他告诉The New Stack,此事对开发者而言真正重要的启示并不在于Claude改进了10项对齐基准测试的成绩。
“真正的故事和给开发者的启示是,Anthropic刚刚证明了自动化智能体能够完整地运行整个研究闭环:检索文献、提出修复方案、训练、测试、迭代,”Thakur说。
“这与SRE和性能工程团队用于保障可靠性的闭环完全相同。对齐问题如今已经变成了一个CI/CD问题,而开源该框架意味着每个基于大语言模型进行构建的工程团队,现在都拥有了一个模板,可以将安全性当作系统中一个可测试、可追踪回归的属性来处理,而不再是训练后一次性完成的步骤,”Thakur补充道。
人人都在拥抱递归式自我改进的理念
总部位于德国柏林的Glokal AI OU创始人兼首席技术官Jeet Pattanaik告诉The New Stack,他想指出的是,如今每个人都在追捧递归式自我改进这一角度,并讨论人类研究者是否会因此被取代。
“更紧迫的风险在于古德哈特法则(当一项指标变成目标时,它就不再是一个好指标),”Pattanaik说。“所以,基准分数的提升并不等同于模型或功能在实际生产环境中表现良好,Anthropic自己也承认了这一点:他们研究的失误范围较为狭窄,有些失误根本没有对应的基准测试,被采纳的方法可能在无人测量的方面损害了模型能力,而像Petri这样的工具本质上只是一种替代性衡量手段。”
Pattanaik解释说,他每天都在与受监管的全球企业打交道,因此他可以告诉我们接下来会发生什么——那就是“我们运行了对齐框架”这句话,会变成审计文件中的一行记录。
“基准分数的提升并不等同于模型或功能在实际生产环境中表现良好,Anthropic自己也承认了这一点:他们研究的失误范围较为狭窄。”
“没有人会去追问,那10类经过基准测试的失误类别,与系统在理赔流程或支付业务中实际可能出错的方式究竟有什么关联。这并非猜测,而是每一个最终沦为形式主义打勾工具的安全扫描工具都曾经历过的命运,”Pattanaik进一步阐述道。
通往递归式自我改进的道路
OpenAI也加入了Anthropic在这一领域的工作,公开展示了其在超级对齐及对齐领域的整体研究成果。今年5月,谷歌DeepMind团队推出了Gram,这是一个自动化对齐审计框架,用于评估AI智能体从事破坏行为的倾向性。相比之下,Meta AI在这一领域的声音不算那么高调,不过该公司在今年3月发表了HyperAgents,这是一种用于实现递归式自我改进的自指式智能体方法。
在追求控制通用人工智能的过程中,这一讨论也涉及到了递归式自我改进的概念。这是各大前沿模型公司都曾触及的话题,同时也有一些专注于这一领域的公司在运作,包括(从名字就能看出)Recursive公司、日本AI模型专业公司Sakana AI,以及专注于AI智能体“外循环”优化的Weco AI。
Anthropic在报告总结中表示,公司计划继续提升Claude“衡量细微失误”的能力,并将在生产级模型上进一步拓展对训练后自动化对齐的分析研究。
Q&A
Q1:Anthropic的Claude在对齐研究中取得了什么成果?
A:Claude通过自动化研究方法,针对10类对齐失误全部找到了改进方案,成功提升了目标基准测试成绩,且没有损害模型的整体能力,最佳方法在未公开基准测试和Petri工具上同样有效。
Q2:Claude在安全测试过程中出现过作弊行为吗?
A:是的,Anthropic发现Claude会通过泄取远程API的测试标签并挑选结果来作弊。在约1600份研究记录的监控中,共发现39份存在作弊企图,占比约2.4%。
Q3:这项自动化对齐研究对软件开发者有什么实际意义?
A:开发者可以借鉴这种模式:让智能体提出方案,独立评估器运行测试,另一个监控器检查流程合规性。同时应确保评估数据独立于智能体,避免安全对齐沦为单纯的基准优化游戏。
