AI模型互训已成为众多前沿实验室的热门目标,如今Anthropic研究员项目中的一位研究员,为我们提供了一个关于这一过程在实践中如何运作的早期视角。

近日,Anthropic发布了一篇题为《自动化研究员能可靠缓解对齐失败问题》的新论文,详细介绍了AI系统如何可靠地提升模型在一系列对齐基准测试上的表现。当系统被赋予10项针对特定"未对齐行为"的基准任务时,自动化系统能够在不降低模型整体性能的前提下,在每一项基准上实现性能提升。

该项目由Anthropic研究员陈岳翰(Chen Yueh-Han)主导,系统在很大程度上复现了传统科研流程:每个自动化系统搜索现有文献、提出研究方法,并使用该方法对模型进行30分钟的训练,通过多轮迭代逐步提升基准分数。有效的方法被保留,无效的则被淘汰,使系统得以快速运行,并可大规模扩展。

论文写道:"总体而言,这些结果提供了早期证据,表明自动化对齐后训练在近期内可能具备实用价值。"

这篇论文是迈向"递归自我改进"的重要一步。许多人认为这是AI进步的下一个关键节点——如果模型能够自主改进对齐训练,那么在更广泛的训练实践中实现自我优化也将成为可能,届时,人类AI研究员或许将逐渐失去用武之地。

论文对此并不回避,直接将自动化对齐研究员(AAR)与人类研究员进行了对比。论文指出:"最佳AAR方法平均在六小时内便能超越有经验的人类研究员的提案,而人工主导的研究方向并不能带来更强的性能表现。"

论文还附上了成本对比,以增强说服力:"AAR每小时的API推理成本约为4美元,而我们支付给人类研究员的费用约为每小时150美元。"

当然,论文也坦诚指出了该方法的若干局限性。自动化系统的有效性,有赖于基准测试能否真实反映对齐目标,而在建立和维护这些基准方面仍有大量工作要做,更不用说还需要持续维护并扩充自动化研究员所依赖的文献库。

Q&A

Q1:Anthropic发布的自动化对齐研究员(AAR)是什么?

A:AAR是Anthropic提出的一种自动化AI系统,能够模拟人类研究员的工作流程,通过搜索文献、提出方法并训练模型,自主提升模型在对齐基准上的表现。在10项对齐基准测试中,AAR在不降低整体性能的前提下,对每一项均实现了性能提升,最佳方法平均六小时内即可超越有经验的人类研究员的提案。

Q2:AAR和人类研究员相比,成本差距有多大?

A:根据论文披露的数据,AAR每小时的API推理成本约为4美元,而Anthropic支付给人类研究员的费用约为每小时150美元,成本差距约为37倍。论文同时指出,AAR在性能提升效果上平均也优于人类研究员提出的研究方向。

Q3:AAR这种自动化对齐系统有哪些局限性?

A:论文指出,AAR的有效性高度依赖于基准测试能否真实反映对齐目标。若基准设计不当,系统可能只是在优化指标而非真正解决对齐问题。此外,建立和维护这些基准本身需要大量人工投入,系统所依赖的文献库也需要持续扩充和维护,这些都是当前阶段尚待解决的问题。

TechCrunch - AI