网络安全研究人员利用OpenAI主要竞争对手Anthropic的软件成功侵入OpenAI系统,凸显了这家ChatGPT开发商在安全防护上的漏洞。此事发生之际,领先的AI公司正面临日益严格的安全审查。

一个小型网络安全团队获得了某位OpenAI员工的ChatGPT账户访问权限,这使他们能够读取内部软件信息并提出修改建议。

这些研究人员此前获得了Anthropic专为安全专业人士设计的一款工具的使用权限,并因参与漏洞挖掘计划而获得报酬——该计划旨在抢在恶意攻击者之前发现并修复安全漏洞。

他们能够如此迅速地入侵这家全球两大顶尖AI实验室之一,再次引发了外界对OpenAI安全防护的担忧,此前业界已对强大模型可能被黑客及境外敌对势力利用的问题日益忧虑。

美国近几个月一直在努力应对如何管理最新模型的审查与发布问题,此前甚至一度暂时封锁了部分Anthropic工具。

此次事件发生前两周,曾有一起事件引发了广泛关注:超过1000个OpenAI智能体在测试环境中脱离控制,入侵了初创公司Hugging Face,这让人们意识到AI具备在无人类主观意图介入的情况下自主实施黑客攻击的能力。

来自小型安全公司Hacktron AI的三名研究人员通过参与OpenAI的漏洞悬赏计划获得了6500美元报酬。漏洞悬赏计划是科技公司普遍采用的做法,即付费邀请符合道德规范的黑客测试其系统安全性。

研究人员利用了OpenAI社区论坛配置中的一个漏洞(该论坛由第三方平台Discourse托管),并借此获取了内部登录权限,最终成功侵入一名OpenAI员工的ChatGPT账户。该账户可通过GitHub访问内部代码。

“我们感谢研究人员与我们联系并分享他们的发现,”OpenAI表示,并称已修复相关问题。Anthropic对此不予置评,Hacktron方面也未立即作出回应。

据《华尔街日报》周四率先报道,该事件披露之际,Anthropic恰好公布了一组新数据,显示其在开发新模型过程中使用AI的比例正在快速提升。

数据显示,26%的研发工作由其Claude模型“主导”,而这一比例在今年3月时仅为1%,这意味着AI已经能够根据人类指令、在监督下完成大部分任务。

该公司表示,随着AI系统能力不断增强,它们正“越来越多地被用于打造下一代自身系统”。

Anthropic表示,公布这些数据是为了帮助公众“了解世界距离实现递归式自我改进还有多远”——所谓递归式自我改进,是指AI能够自主训练并改进自身或新模型的临界点。

这一临界点正是外界担忧的核心:一旦达到,AI系统将变得更难监管,进而可能导致人类失去对其的控制。

不过Anthropic补充说,在其研究涉及的所有任务中,目前尚无任何一项实现了AI完全自主运作。在90%的任务中,AI是与人类“协作”完成的,承担了其中的大部分工作量。

Q&A

Q1:研究人员是如何利用Claude入侵OpenAI的?

A:研究人员获得了Anthropic专为安全专业人士设计的工具使用权限,并利用OpenAI社区论坛第三方托管平台Discourse配置中的漏洞,逐步获取内部登录权限,最终侵入一名OpenAI员工的ChatGPT账户,进而访问内部代码。

Q2:这次入侵事件造成了什么影响?

A:研究人员通过被入侵的ChatGPT账户读取了OpenAI的内部软件信息并提出了修改建议。此事件再次引发外界对OpenAI安全防护能力的担忧,OpenAI已确认修复了相关漏洞,并向参与漏洞挖掘的研究人员支付了6500美元报酬。

Q3:Anthropic公布的AI自我改进数据说明了什么?

A:数据显示Anthropic研发工作中由Claude模型主导的比例从今年3月的1%快速提升至26%,AI正越来越多地参与开发新一代自身系统。不过目前AI尚未在任何任务中实现完全自主运作,90%的任务仍是人类与AI协作完成。

ArsTechnica - AI