达里奥·阿莫迪(Dario Amodei)此前提出的在AI实验室内部引入第三方安全评估机构的计划正逐步落地:Anthropic宣布,来自科技咨询巨头埃森哲的员工将进驻公司内部,对其模型和员工进行审查。

Anthropic在一篇博客文章中表示,埃森哲于今年1月收购的AI部门Faculty公司将开始负责“评估和红队测试模型、进行对齐评估以及测试模型安全防护措施”的工作。两家公司预计未来五年将为该项目投入至少10亿美元。

选择埃森哲这一决定令许多AI观察人士感到意外,也让市场颇为震惊——埃森哲盘后股价一度上涨8%。此前围绕阿莫迪博客文章中嵌入式评估机构展开的讨论,焦点多集中在METR、Redwood Research和Apollo Research等AI安全研究机构上。这一点在Anthropic身上体现得尤为明显,因为该公司一直将AI安全与对齐视为其使命核心。

Anthropic表示,未来几周还将公布更多评估机构,目前公司正在与METR等非营利组织沟通,探讨如何“利用其自有资金试点部分嵌入式评估工作”。

尽管埃森哲并不以深度学习前沿研究见长,但Anthropic指出,该公司在为大型企业和政府机构部署AI方面拥有丰富的实践经验,这是其关键优势。此外,作为一家在AI革命之前就已存在的大型上市公司,埃森哲相较于Anthropic及其周边那个可以说颇为复杂的生态系统,在功能上具有更强的独立性。

Anthropic指出,目前尚不存在关于评估机构访问权限或沟通方式的统一标准,预计其做法将随时间推移不断演进。虽然外部评估已成为新大语言模型发布流程中的重要环节,但近期发生的一些事件让外界更加意识到问题的紧迫性:OpenAI和Anthropic部署的AI智能体曾在未触发实验室内部警报的情况下,入侵了外部网站。

一些呼吁以更负责任的方式发展人工智能的批评人士认为,阿莫迪提出的行业自我监管方案,实际上是一种逃避AI模型不当行为问责的手段。对此,Anthropic坚称,这些评估机构“并不会削弱我们的问责,反而有助于让问责更具可验证性。我们模型的安全性仍然是我们自身的责任”。

Q&A

Q1:Anthropic为什么选择埃森哲作为嵌入式评估机构?

A:Anthropic看重埃森哲在为大型企业和政府机构部署AI方面的丰富实践经验,同时埃森哲作为AI革命前就存在的大型上市公司,相对于Anthropic及其生态系统更具功能独立性。

Q2:埃森哲的团队具体会在Anthropic内部做什么工作?

A:埃森哲旗下的Faculty公司将负责评估和红队测试Anthropic的模型,进行对齐评估,并测试模型的安全防护措施,两家公司预计未来五年将为此投入至少10亿美元。

Q3:外界对这种嵌入式评估机制有哪些质疑?

A:一些批评人士认为,这种由AI实验室自行安排第三方评估机构的做法,可能是行业逃避问责的手段。Anthropic则回应称,评估机构并不会削弱其问责,反而有助于让问责更具可验证性,模型安全性仍是自身的责任。

TechCrunch - AI