据《华尔街日报》周四晚间报道,在一个折射当前AI安全奇特状态的事件中,独立安全研究人员利用Anthropic的Claude入侵了OpenAI,暴露出这家ChatGPT开发商防御体系中的漏洞。
初创公司Hacktron AI的一个三人安全团队在OpenAI漏洞赏金计划框架下实施了此次攻击。Hacktron将研究成果报告给OpenAI,后者向该团队支付了6500美元奖金。该团队成功串联两个关键漏洞,进入了多个OpenAI员工的ChatGPT账户,进而访问了公司的软件系统。
OpenAI表示已修复Hacktron发现的问题,而这一事件恰逢顶级AI公司在安全方面面临日益增长的压力之际。
就在几周前,OpenAI自家的AI智能体在一次网络安全评估中突破限制,入侵了Hugging Face,这表明AI模型在自主决策方面的能力正变得越来越强。此次事件也凸显出,即便是最先进公司的基础设施,也可能被现成的技术工具找到漏洞。
“每月200美元,任何人都可以使用这些工具入侵像OpenAI这样的公司,”AI安全公司Gray Swan首席执行官马特·弗雷德里克森对TechCrunch表示,“如果这能发生在他们身上——而且我认为他们近期在网络安全防护方面并未懈怠——那这种事就可能发生在任何人身上。”
正如一位AI评论人士在社交媒体上所说:“Hacktron用Opus 5完成了这次入侵……接下来人们要问的问题是,如果这三个人能做到这一点,一个国家能做到什么程度。”
研究人员在7月25日通过Discourse中的一个漏洞找到了进入OpenAI系统的路径,Discourse是驱动OpenAI社区论坛的第三方软件。
根据研究人员发布的博客文章,入口点是一个看似普通的图片上传功能。当用户向OpenAI社区论坛上传HEIF或HEIC格式的图片文件(iPhone默认使用的格式)时,Discourse会将其通过一连串幕后工具链转换为标准的JPEG格式。第一站是ImageMagick,这是一个有着几十年历史的开源图片缩放工具。由于ImageMagick常规工具集无法处理苹果的格式,它会将文件转交给另一个名为libheif的库进行解码。
libheif内部隐藏着一个内存漏洞,为攻击者留下了植入自定义指令的通道。在这起案例中,向该库输入一张精心构造的图片,会导致其错误计算一张图片叠加在另一张图片上的位置,这足以劫持服务器。
令网络安全界感到尴尬的是,该漏洞其实早在几个月前就已被libheif的开发者修复。但这一修复从未被正式标记为安全漏洞,也就是说它从未获得CVE(通用漏洞披露)编号——这是业界追踪已知安全弱点的标准方式。Hacktron表示,这或许可以解释为何Discourse所使用的软件当时仍在运行存在漏洞的旧版本。
值得注意的是,研究人员表示,他们最初使用的Claude模型——一个专为网络安全研究人员提供的Opus 4.8特别版本——起初无法构建出可用的漏洞利用程序。但情况在一夜之间发生了变化,当时Anthropic发布了Opus 5。
“Opus 4.8在多次尝试中都未能生成可用的漏洞利用程序,”Hacktron在博客文章中写道,“但在Opus 5发布数小时后,我们向其提出了同样的问题,它成功了。”
进入Discourse服务器后,研究人员发现了另一个漏洞,使他们能够接管用户的ChatGPT和Codex账户,其中包括OpenAI员工的账户。
“随后,我们接管了一名OpenAI员工的账户,其Codex与OpenAI的GitHub组织相连,”Hacktron在事件总结中写道。
此时,研究人员向OpenAI及Discourse发出了警报,Discourse于7月27日发布了修复补丁。
此次事件将焦点聚集在模型能力边界的划定问题上。最终破解漏洞的Claude Opus 5版本并未受到任何安全出口限制,这与更新的版本Mythos 5形成对比——后者曾因其先进的黑客能力引发担忧而被暂时锁定。
这还只是闭源模型的情况。开源权重模型在网络能力方面正日益追赶前沿水平。例如,AI安全非营利组织SaferAI近期发现,中国公司智谱(Z.ai)的GLM-5.2仅落后OpenAI的GPT-5.5和Anthropic的Claude Opus 4.7几个月时间。
正如Hacktron创始人莫汉·佩德哈帕蒂在X平台上所言:“AI正在降低开发漏洞利用程序所需的稀缺专业知识门槛。过去需要数月才能完成的工作,如今几天就能实现。”
Q&A
Q1:研究人员是如何用Claude入侵OpenAI的?
A:Hacktron AI的三人安全团队通过Discourse论坛软件中一个未被正式标记的图片处理漏洞找到入口,利用Claude Opus 5模型构建出可用的漏洞利用程序,成功串联两个关键漏洞,进入了多个OpenAI员工的ChatGPT账户。
Q2:这次入侵利用了什么具体漏洞?
A:漏洞出在Discourse处理HEIF/HEIC图片格式的过程中,涉及ImageMagick和libheif两个工具的转换链条。libheif中存在一个内存漏洞,攻击者通过构造特殊图片,可以劫持服务器,而该漏洞虽已被开发者修复,但因未获得CVE编号而未被及时更新到Discourse中。
Q3:OpenAI对此事件做了什么处理?
A:OpenAI通过漏洞赏金计划向Hacktron支付了6500美元奖金,并表示已修复被发现的安全问题。Discourse方面也在收到警报后于7月27日发布了相应修复补丁。
