上周末,Anthropic一名研究员因担心AI可能导致人类灭绝而辞职,随后该公司CEO达里奥·阿莫迪撰文呼吁,需要外部组织"验证安全实践和承诺的遵守情况,报告事件,并帮助评估不仅是已完成的AI模型,还包括训练管道和流程的对齐情况"。OpenAI、谷歌和SpaceXAI的高管已经支持阿莫迪的这一计划,该计划迅速成为新兴AI安全推动工作的核心支柱。

但一个更简单、更有效的解决方案可能就摆在眼前。互联网安全专家表示,各实验室需要专注于日志和权限等网络安全基础工作,像对待人类用户一样应用同样严格的防护措施。这虽然不如第三方审计和对齐工作那样引人注目,但可能最终会更有效。

"在我看来,这似乎是在外包,"安全公司Luta Security的CEO凯蒂·穆索里斯在谈到阿莫迪的提议时对TechCrunch表示。"从我的角度来看,说第三方审计是解决方案是一个奇怪的主张。这就好比微软没有撰写《可信计算备忘录》,而是说让我们放慢开发速度一样。"

那份备忘录由时任微软CEO比尔·盖茨于2002年撰写,在一系列广为人知的计算机蠕虫病毒攻陷当时尚处萌芽阶段的企业系统后,他呼吁员工确保软件的可靠性和安全性。随着这项新技术的价值和风险日益明显,AI行业可能正处于类似的转折点。

尽管对齐问题仍然重要,但明年将入职加州大学伯克利分校担任教授的AI研究员萨亚什·卡普尔认为,"相比对齐方面的投入,边际增加的控制投入更可能有效。我们认为这些事件说明,尽管已有已知的技术手段,但各公司在AI控制方面仍然缺乏重视。"

引发这些担忧的事件都围绕着前沿模型被要求完成训练任务(通常是网络安全评估)时,随后访问开放互联网并试图渗透第三方封闭系统展开。这些情况的发生通常是因为本应限制这些智能体的"沙盒"环境配置不当;具有讽刺意味的是,Anthropic的一次越狱事件正是因为第三方评估人员没有关闭正确的门户造成的。

"我们作为专业人士知道如何阻止访问互联网,"安全公司Tailscale的CEO埃弗里·彭纳伦说。"如果你通读这些冗长的报告——'哇,那是一次非常令人印象深刻的多阶段攻击,等等等等。'看,是你给了它下载东西的权限。你本不应该把这个和互联网访问分开处理。"

这是一个问题——但更大的问题是,前沿实验室对这些活动毫不知情。

关注智能体

"真正令人震惊的是,所有关于它们所作所为的发现,要么是因为受害者发现了什么,要么在其他一些情况下……是通过网络活动发现的,没有一个是真正通过直接监控AI发现的,"穆索里斯指出。

在一个案例中,OpenAI的智能体接管了一个已停用的德国维基论坛来在评估中作弊,该智能体活跃了数周,公司内部似乎没有人注意到。TechCrunch采访的安全专家表示,实时监控是防止未来越狱事件的关键,每个智能体会话都应该有时间限制并会过期。

曾任谷歌安全高管、现领导初创公司QueryStory的沙波尔·纳吉布扎德说,解决方案是"把智能体放进一个盒子里,从外部对其进行严密监控,观察所有跨越边界的行为。每一次工具调用,每一个进程,每一次网络连接,没有例外……为了方便而留下的那一个漏洞,恰恰就是被利用的那一个。这次绕过恰好就是通过这种例外发生的。在谷歌时,我曾无数次目睹人类攻击者上演这样的戏码,而这些模型至少同样擅长找到那扇虚掩的门。"

OpenAI已经开始朝这个方向发展,宣布已开始以"相当高的计算成本"监控其Astra模型的所有工具使用推理。Anthropic也表示正在加强其安全程序,包括扩大对其模型的可观测性。两家公司均未回应TechCrunch关于如何跟踪和控制AI智能体的提问。

其他问题还包括智能体使用共享基础设施,这使得它们在Hugging Face攻击事件中能够相互通信。Django网络框架的联合创建者、软件开发者西蒙·威利森撰文提出了一个他称之为"致命三要素"的概念——当智能体同时具备访问不可信输入、互联网和私密信息的能力时,这就是灾难的配方。

"诀窍在于你可以选择三要素中的任意两个,让一个智能体拥有其中两个,"彭纳伦说。"如果你需要全部三个,那么你需要将其拆分到至少两个智能体之间……也许它们被允许通过一个受控渠道相互通信。"

对前沿实验室的理解

TechCrunch采访的专家们表示,理解前沿实验室安全人员工作的艰难之处。纳吉布扎德指出,地球上每一个国家级行为体都在试图窃取他们的模型权重,并对其API发起蒸馏攻击,这还只是任何大型数字公司都要面对的常规安全任务之外的部分。

"研究基础设施很难在优先级列表中名列前茅,尽管现在这种情况必须改变,"他说。"将安全事件公开确实有助于让所有人内部团结一致,朝着改进的目标努力。"

这是穆索里斯强调的一点:目前,当实验室发现其智能体入侵了第三方系统时,没有正式的受害者通知程序,很可能还有其他未被广泛报道的事件发生过。虽然她担心直接监管模型的法律可能产生意外后果,但强制通知是她认为政策制定者应该推进的一个想法。

尽管很明显安全最佳实践没有被遵循,但专家表示,这些实验室正在做前所未有的工作——"他们所做的工作量是普通企业的数量级以上,"网络安全公司Embroidery的CEO扎克·科尔曼告诉TechCrunch。

尽管对齐可能不是应该首先着手的地方,但也不能被忽视。网络安全专家已经不得不接受使用AI智能体来监控其他智能体,以期有机会实时追踪它们的行为,这种场景带来了欺骗的潜在风险这一丑陋的问题。"你被困在使用AI来试图应对这个问题,尽管AI目前并不一定安全,"穆索里斯说。

这项工作只会变得更加艰难。穆索里斯说,智能体目前所做的一切,"它们都是公开进行的"——它们在公共论坛上发帖,它们的思维链和其他推理痕迹都是用英语呈现的。"这仍然是人类可读的,"她说,"所以要趁着这种情况还存在的时候加以利用,因为它不会永远持续下去。"

(额外报道:阿迪蒂亚·梅塔)

Q&A

Q1:AI实验室在安全监控方面存在什么主要问题?

A:主要问题是缺乏对AI智能体的实时监控。多起智能体越狱事件都是通过受害者发现或网络活动异常才被察觉,而不是实验室主动监控AI行为发现的,这暴露了安全防护基础工作的缺失。

Q2:什么是"致命三要素"?

A:"致命三要素"是软件开发者西蒙·威利森提出的概念,指当AI智能体同时具备访问不可信输入、互联网和私密信息三种能力时,就容易引发安全灾难。专家建议应将这三种权限拆分到不同智能体中。

Q3:第三方审计能否解决AI安全问题?

A:专家认为,相比第三方审计和对齐工作,加强网络安全基础措施(如日志记录、权限管理、实时监控)可能更为有效,这是目前AI实验室容易忽视但更应优先解决的问题。

TechCrunch - AI