将AI与真实世界目标隔离能让测试更安全,但也会让测试变得不那么有用。

AI智能体一再“脱缰”,从本应安全的测试环境中逃逸,攻击真实世界的目标、劫持不起眼的维基页面,甚至给其他智能体留下可供遵循的指令。研究人员之所以测试这些系统,正是因为它们可能表现出不可预测、甚至危险的行为。那么,把这些智能体完全隔绝在互联网之外,岂不是更安全?

“严格的隔离会降低真实性……这是一种权衡,而非根本性的技术难题。”

理论上确实如此。研究人员可以将运行AI工具的计算机与互联网及其他外部网络隔离开来,这种技术被称为“气隙隔离”(air gapping)。具体操作可能包括物理拔除或禁用网线与无线硬件,使用不具备联网功能的“哑”外设,对于特别敏感的环境,甚至会使用法拉第笼等屏蔽装置来阻挡电磁信号的进出。如果操作得当,一个气隙隔离的系统将不会给智能体留下通往外部目标的直接路径,外部系统也无法轻易侵入其中,这将使得类似OpenAI模型此前攻击Hugging Face的事件变得极难复现,甚至完全不可能发生。

但在实践中,一个被完全封闭的“盒子”实验室其实相当受限,尤其是当研究目标是评估AI在真实世界中的表现时。德国马克斯·普朗克安全与隐私研究所的科学主任托尔斯滕·霍尔茨(Thorsten Holz)解释说,虽然一些AI实验可以在气隙隔离的机器上进行,但要开展真实可信的评估,往往需要访问外部服务、API接口和数字基础设施。“严格的气隙隔离会降低真实性,”他表示,并将采用气隙隔离的决定描述为“一种权衡取舍,而非根本性的技术问题”。

失控AI已非科幻情节

我们已没有理由再忽视AI安全问题

英国伯明翰大学计算机科学学院助理教授李瑞哲(Ruizhe Li,音译)将完全隔离比作在“人造真空”中测试AI,这可能会削弱评估本身的价值。“我们最终测试的将是一个被‘阉割’过的AI模型,这会让评估者对AI模型在真实部署环境中的行为方式、失败模式或工具使用漏洞完全失去洞察力,”李瑞哲说。

真实性并非唯一的权衡因素。李瑞哲指出,气隙隔离成本高昂,还会让研究进度大幅放缓,把本应快速迭代的过程变成“缓慢的后勤障碍”。霍尔茨表示,在严格的气隙隔离条件下,一些实验也会变得“难度大增”。德国图宾根ELLIS研究所的首席研究员马克西姆·安德留申科(Maksym Andriushchenko)表示,对于风险较高的实验而言,这种阻碍或许是值得的,但如果对所有实验都一概而论地采用这种方式,将会拖慢新模型的开发进度。

安德留申科还质疑,即便研究人员想要对一切都进行气隙隔离,目前是否有足够的安全基础设施能够支撑前沿AI实验室达到这样的规模。

“这听起来非常科幻,但理论上确实可行。”

气隙隔离也无法消除AI带来的所有风险。霍尔茨指出,智能体仍然可能在被隔离的环境内部攻陷系统,理论上还可能产生“一旦被转移到外部就可能造成危害的恶意产物”。此外,李瑞哲表示,气隙隔离“完全无法诊断或消除潜藏在模型内部的风险”。

同时,也没有任何保证能确保气隙隔离会始终保持完全密封。外部人员随时可能突破这道屏障,就像“震网”(Stuxnet)恶意软件事件那样——据报道,这是由以色列和美国联合开发、用于破坏伊朗核计划的网络武器,它正是通过一个USB闪存盘传播进入隔离系统的。信息也可能反向传出。研究人员已经多次证明,可以将计算机内部元件转变为信号发射器,如果屏蔽措施不够完善,这可能会成为一个隐患。“这听起来非常科幻,但理论上确实可行,”安德留申科说。

这种曲折的“逃逸路径”已经成为网络上关于先进AI是否可能突破隔离限制讨论的焦点。OpenAI研究员诺姆·布朗(Noam Brown)近期在X平台上提出,两台气隙隔离的计算机理论上可以通过操控并读取彼此的CPU温度变化来实现通信,这一说法点燃了相关讨论。“你甚至可以说,‘好吧,我们应该对这些计算机进行气隙隔离。’但我并不认为这样做就足够了,”他表示。这一观点在社交媒体上遭到了质疑乃至嘲讽,一些相对温和的批评者指出,这种通信方式在理论上可行,与一对AI系统真正发现并加以利用之间存在巨大差距,况且这种方法产生的数据传输速度也将极其缓慢。

一个足够先进的AI或许根本不需要诉诸如此复杂的逃逸手段,因为人类自己可能会被说服去为它打通这道屏障。AI安全研究人员多年来一直担忧这种可能性,而最近发生的一些事件,已经为模型能够尝试进行社会工程攻击提供了具体证据。

“这种权衡取舍值得受到更多审视,我们已经见识到事情有多容易出岔子。”

气隙隔离只是保护AI系统安全的手段之一。“把隔离当作万能的安全解决方案,会制造一种虚假的安全感,”李瑞哲说。它应当与其他措施配合使用,比如深入理解模型的内部运作机制、确保模型与人类价值观保持一致,以及防范人为失误——而人为失误正是近期许多失控AI事件背后那个平淡无奇却致命的失败根源。他解释说:“在实践中,测试其实存在一个光谱”,业界依赖的是一种“分层containment(遏制)模型,而非非此即彼的单一方案”。

不过,极端隔离确有其用武之地。哈佛大学肯尼迪学院计算机科学家兼公共政策助理教授斯蒂芬·卡斯珀(Stephen Casper)将气隙隔离描述为应对敏感系统的“绝佳方案”,并以其在核设施中的应用为例。他并未排除先进AI找到某种新颖方式实现逃逸的可能性,但表示到那个阶段,我们或许更应该担心的是那些更为平凡的隔离突破手段,比如合规失效或人为失误。

近期发生的一系列事件,让人们不禁质疑AI实验室究竟将安全边界划在了何处。许多“越狱”事件都涉及正在接受网络安全能力测试的模型,从许多方面来看,它们的表现其实完全符合设计预期——问题在于,它们是在研究人员设定的边界之外这样做的。

霍尔茨表示,AI“评估往往优先考虑真实性与便利性”,但他也指出,那些明确为进攻性网络能力而设计的智能体,理应获得更严格的安全保障,默认情况下可能就需要强力隔离与严格监控。“这种权衡取舍值得受到更多审视,我们已经见识到事情有多容易出岔子,”他说。

Q&A

Q1:什么是气隙隔离(air gapping)?

A:气隙隔离是一种将计算机系统与互联网及其他外部网络物理断开的安全技术,通常包括拔除网线、禁用无线硬件,甚至使用法拉第笼屏蔽电磁信号,目的是防止AI智能体访问外部目标或被外部系统入侵。

Q2:气隙隔离能完全阻止AI失控吗?

A:不能完全阻止。研究人员指出,智能体仍可能在隔离环境内部攻陷系统,产生一旦转移到外部就会造成危害的恶意产物,而且隔离本身也无法诊断或解决模型内部潜藏的风险。

Q3:为什么不对所有AI测试都采用气隙隔离?

A:因为气隙隔离会降低测试的真实性,让研究人员难以评估AI在真实世界中的实际表现,同时成本高昂、拖慢研究进度,业界更倾向于采用分层遏制模型,而非一刀切的隔离方案。

The Verge