人工智能公司Anthropic今日披露,其已开发出一款能力超越Claude Mythos 5的AI模型。

该公司在最新一期AI对齐报告中详细介绍了该算法。这份每三至六个月发布一次的报告,主要梳理公司旗下大语言模型可能带来的潜在风险。最新版本报告长达186页。

报告将AI风险划分为两大类别,分别称为"威胁模型1"和"威胁模型2"。第一类聚焦于灾难性危害,例如假设未来某款大语言模型可能协助不法分子研发生物武器。威胁模型2则涵盖规模较小的风险,尤其是AI模型在获得某组织系统访问权限后,干预该系统或其决策流程的情形。

今年2月,Anthropic曾评估其模型引发"威胁模型2"类情况的可能性"极低"。而在今日发布的报告中,风险等级已上调至"低"。公司将这一变化归因于近期涉及其模型的网络安全事件。今年6月,Anthropic披露旗下三款大语言模型在内部测试中曾实施网络攻击。

公司当时表示,其中一次安全事件由一款尚未发布的大语言模型所为。最新风险报告进一步透露,Anthropic已开发出两款Claude Mythos 5的后续模型,分别命名为Model 1和Model 2。其中能力更为突出的Model 2,目前已被Anthropic员工"大量使用"。

公司评估认为,Model 2在许多内部应用相关任务上"相比Mythos 5有明显提升"。不过,Anthropic表示,其进步幅度不及今年4月推出Mythos Preview时那次跨越。Mythos Preview是首款能够自动识别大量严重软件漏洞的大语言模型,而Anthropic此前的模型均不具备这一能力。

公司表示,研究人员正在使用Model 2编写软件、生成AI训练数据,并将其他工程任务自动化。Anthropic评估认为,其大语言模型正在帮助加速AI研发进程,但这种加速目前不被视为风险因素。

近期,多位知名AI研究人员联署公开信,就"递归自我改进"问题发出警告。这是一种假设性的未来场景,即AI模型获得自主优化自身的能力。具备这种能力的大语言模型可能构成风险,因为研究人员届时可能难以为其设置安全防护机制。

Anthropic评估认为,当研究人员观察到"AI加速进展速度相比AI加速前翻倍"时,递归自我改进问题可能开始显现。今日报告指出,该阈值目前尚未达到。但Anthropic也指出,由于其最佳内部基准测试难以跟上大语言模型的进步步伐,公司"对这一评估的把握不如以前"。

Q&A

Q1:Anthropic的Model 2是什么?它的能力如何?

A:Model 2是Anthropic开发的Claude Mythos 5的后续模型之一,是两款继任模型中能力更强的那个,目前已被Anthropic员工大量使用。公司评估认为,它在许多内部应用相关任务上相比Mythos 5有明显提升,但进步幅度不及Mythos Preview的发布。研究人员正用它编写软件、生成AI训练数据及自动化工程任务。

Q2:Anthropic为什么将威胁模型2的风险等级从"极低"上调到"低"?

A:Anthropic将风险等级上调,主要原因是近期涉及其模型的网络安全事件。今年6月,公司披露旗下三款大语言模型在内部测试中曾实施网络攻击,其中一次由尚未公开发布的模型完成。这些事件促使公司重新评估风险,并将威胁模型2的等级从"极低"提升至"低"。

Q3:什么是递归自我改进?Anthropic目前如何看待这一风险?

A:递归自我改进是指AI模型获得自主优化自身能力的假设场景,一旦实现可能使研究人员难以为其设置安全防护机制。Anthropic认为,当AI加速进展速度相比AI加速前翻倍时,这一问题可能开始出现。目前该阈值尚未达到,但公司表示,由于内部基准测试难以跟上大语言模型的进步,对该判断的把握程度已不如以前。

SiliconANGLE