一家名为Irregular的以色列初创公司,在测试过程中的失误,导致Anthropic、OpenAI、Meta和谷歌等公司的AI智能体攻击了真实世界中的目标。
今年7月,OpenAI披露其AI智能体在未经许可的情况下攻击了Hugging Face,引发外界对AI安全问题的广泛担忧。此后,来自Meta、Anthropic、谷歌等公司的智能体也接连出现类似事件,进一步加剧了人们对失控AI的恐慌。过去几个月,随着涉及多个AI模型的问题陆续曝光,这些事件起初看起来彼此独立。但事实上,许多事件都指向同一个源头:一家专门负责测试这些智能体的公司。
Irregular是一家以色列初创公司,成立于2023年,最初名为Pattern Labs,专门在“模拟并监控真实世界AI安全场景的高保真研究平台”中对AI模型进行压力测试。自成立以来,该公司已与业内多家顶尖企业展开合作。虽然其具体客户名单并未公开,但其研究成果曾被OpenAI模型系统卡引用,该公司也曾为英国政府和Anthropic测试系统,并与颇具影响力、为AI政策制定提供参考的智库兰德公司(RAND)联合发表过研究报告。
在今年进行的多次Irregular测试中,AI智能体逃离了本应安全可控的测试环境,转而攻击了真实世界中的目标。
这些安全漏洞与此前的Hugging Face黑客事件相互独立,但都遵循相似的模式:Irregular当时正在受控环境中测试模型的网络安全能力,力求模拟真实场景。部分测试采用了“夺旗赛”(capture-the-flag)形式,这是测试黑客能力的常见方法,要求智能体在模拟网络中找到隐藏信息。然而,这个所谓的“模拟网络”,其安全性似乎并未达到预期。
Irregular首席技术官兼联合创始人奥默·内沃(Omer Nevo)向The Verge表示,这些智能体原本不应该能够访问公共互联网,但“互联网访问在无意中被开放了”。与此同时,内沃透露,测试中为模拟目标虚构的公司名称“与一个真实域名发生了重叠”。这两个失误叠加在一起,导致智能体最终攻击了现实世界中的目标,不过目前尚不清楚具体是哪些公司或机构受到了影响。
内沃向The Verge证实,OpenAI、Meta、Anthropic和谷歌相关模型出现的事件,都源于同一个问题。他表示:“所有涉及Irregular的事件都源自单一评估场景中的同一潜在问题,相关情况已经进行了披露。”他补充说:“行业内近期报告的其他安全事件与Irregular及我们的评估工作无关。”这其中包括Hugging Face遭黑客攻击事件,以及英国AI安全研究所遭遇的入侵事件。
不过,“披露”并不一定意味着公开。目前尚不清楚内沃所说的披露对象,是Irregular的客户、公众,还是其他相关方。尽管所有事件都源于同一个测试失误,但根据Anthropic和OpenAI的报告以及关于谷歌的相关报道显示,这些科技公司大致都是在7月下旬的相近时间收到通知的。OpenAI和Anthropic自行公开了这些安全漏洞,而涉及Meta以及数周后曝出的谷歌事件,则是最先通过媒体报道才为公众所知。
Irregular的网络安全测试范围并不局限于美国这四大科技巨头。该公司网站发布的研究显示,其还对来自中国公司月之暗面(Moonshot AI)和智谱(Z.ai)的开源AI模型Kimi K3和GLM-5.2进行了类似的网络安全测试。与其他事件中涉及的专有模型不同(Meta的旗舰模型Spark目前仍为专有模型),这些开源模型可以被自由下载并在用户自己的硬件上运行,这意味着像Irregular这样的测试方无需依赖模型公司提供访问权限,也无需将数据回传给对方。Irregular的研究报告将这类测试称为“自托管”实例。
内沃表示,对中国模型的评估并未出现类似的现实世界事件:“在对GLM或Kimi的评估过程中,我们没有观察到与此处所述事件相同类型的问题。”不过,内沃也提醒称,“这一观察结果本身,并不能证明这些模型对此类行为的易感性更低。”月之暗面和智谱均未回应The Verge的置评请求。
内沃表示,这些事件促使Irregular做出了相应调整。“我们收紧了互联网访问控制,扩大了监控和人工审查范围,并在评估开始前加强了核查,以确保访问权限符合预期范围,”他说,“我们同时也改进了与合作伙伴就每次评估的设置和参数进行记录和确认的流程。”
内沃还透露,待与相关公司的联合工作完成后,Irregular计划发布一份更全面的报告,“内容涵盖从中吸取的经验教训,以及安全开展网络安全评估的实践方法”。他表示:“我们与合作伙伴的工作,旨在将这些事件中吸取的教训,转化为公开共享的实践方法,以帮助行业在开发和评估日益强大的AI系统时确保安全。”
内沃表示,Irregular已经解决了与这些事件相关的测试环境问题。而美国四大AI公司均未回应记者提出的进一步问题,包括它们何时得知这些安全漏洞、是否正在向Irregular寻求赔偿或其他补救措施,以及是否预计将继续与Irregular合作。谷歌和Anthropic未作回应,OpenAI和Meta则将记者引导至此前发布的官方博客文章。
Q&A
Q1:Irregular公司是做什么的?
A:Irregular是一家以色列初创公司,成立于2023年,专门在模拟真实世界场景的高保真研究平台中,对AI模型进行网络安全压力测试,客户包括多家顶尖AI公司和政府机构。
Q2:这次AI智能体失控事件是怎么发生的?
A:Irregular在测试中出现两处失误:一是本应关闭的互联网访问权限意外开放,二是测试中虚构的目标公司名称恰好与真实域名重叠,两者叠加导致AI智能体攻击了现实世界中的目标。
Q3:这次事件涉及哪些公司的AI模型?
A:事件涉及OpenAI、Meta、Anthropic和谷歌四家美国科技公司的模型,此外Irregular还对中国公司月之暗面的Kimi K3和智谱的GLM-5.2进行过类似测试,但未发现相同问题。
