随着AI智能体能力不断增强、运行周期持续延长,将安全与信任机制内嵌于其驱动的应用程序中变得愈发重要。NVIDIA人工智能安全团队结合NVIDIA OpenShell项目、智能体开发者、开源社区及生态伙伴的实践经验,对新兴智能体架构进行了系统梳理,重点阐述各层级的角色定位以及安全机制的归属问题。
近期多份报告揭示了安全控制位置的重要性。今年夏天短短数周内,OpenAI、Anthropic以及英国AI安全研究所相继报告,前沿智能体出现了超越预设边界的行为,包括:从实验室环境意外突破至开放互联网、未经授权访问他公司系统,以及对人员和基础设施采取未经批准的操作。这些案例均涉及在弱化模型安全防护下运行的长周期智能体,但它们共同指向同一设计挑战——使智能体能够创造性解决问题、追求复杂目标的能力,同样可能帮助其找到原始指令未曾预见的路径。
NVIDIA最新研究进一步证实了智能体架构中"执行层"的核心地位。研究人员借助智能体变异算子(AVO),在ARC-AGI-3上取得了满分成绩。该基准测试将智能体置于陌生环境中,不提供任何指令、规则或明确目标,专门考察其交互式推理能力。
本文系统梳理新兴智能体架构的主要层级——模型、执行层、元执行层、以OpenShell为代表的安全运行时,以及推理基础设施——并深入阐释各层级如何协同降低风险。同时,本文还将探讨随着这些层级能力不断提升与组合,哪些安全属性将变得至关重要,包括权限归属、访问范围界定,以及运行时如何对智能体行为进行约束与记录。
安全原则的层级化应用
保护智能体并不需要重新发明安全体系。数十年的系统安全实践已积累了经久不衰的原则:最小权限、纵深防御、隔离机制、显式授权和可审计性。核心挑战在于如何将这些原则恰当地应用于智能体架构中。
提示词、模型安全防护和执行层逻辑共同塑造了智能体可能的行为,但它们无法为智能体的能力划定硬性边界。这一区别催生了两类不同的控制机制:引导智能体行为的行为控制,以及限制其权限的基础设施控制。
执行层:行为引导的核心节点
模型和智能体负责提出行动方案,执行层负责统筹调度。三者协同解读目标、处理模糊信息并提出具体行动。执行层是天然的控制节点:它掌管循环流程、上下文管理、工具调用和会话全程,能够将行为引导至运营者的预期方向。然而,这种引导的效果仍然依赖于模型的实际行为表现。
基础设施层:最终权威的所在
智能体运行所在的环境才掌握最终权威。该环境负责管理身份认证、执行策略、控制故障影响范围、记录操作历史,并在相同的已批准策略和已验证状态下始终作出一致的授权决策。它不是在预测智能体会做什么,而是在决定智能体能做什么。
执行层引导智能体的尝试,基础设施控制智能体的能力边界。二者缺一不可,但只有后者具有权威性。
基础设施层的执行并非万无一失,但已批准的策略与经过验证的配置能够产生可复现的结果,智能体无法自主选择是否遵守。策略本身仍可能存在缺陷,外部操作结果也可能存在不确定性。
架构层级划分
上述职责划分对应着开源生态系统正在形成共识的各个层级,可以用OSI网络模型来类比理解这一智能体架构——每个层级承担一项职责,并提供清晰的接口。上层组件的变更不会影响其下方控制层的定义。
这些层级描述的是功能角色:一款产品可能融合多个角色,一次部署也可能将某个角色拆分至多个服务中。安全边界由智能体无法绕过的效果路径来界定。模型提供智能,执行层将智能转化为智能体,运行时决定该智能体被允许做什么。
执行层本身是一个连续谱系,而非固定类别。Codex和Claude Code是观点鲜明的执行层实现,而Pi和DeepSeek Harness(DSH)则将执行层更多地作为可编程基础设施对外开放。通过Cordis,DSH将核心行为以插件形式实现可组合和替换。这种高度可编程性使执行层并不适合承担安全保证职责——一个设计上可被修改的层级,无法可靠地防止针对自身修改的控制被绕过。另一条路径——依赖执行层逻辑保障安全——实质上是对模型行为的假设性编码,而这些假设会随着模型能力的提升而逐渐失效。
运行时安全边界的建立
模型、执行层、运行时、策略和推理部署的选择日益独立化。这种模式要求运行时的安全保证必须独立于其上方运行的任何组件。这意味着安全边界必须在智能体启动时即告确立。
编排器请求OpenShell创建运行时并执行策略与治理规则。所选执行层在该运行时内启动,其插件、模型上下文协议(MCP)进程、工具及其他模型驱动的代码均在同一边界内运行。子智能体获得有上限约束的委派子运行时,且无法突破该上限;编排器则在受其自身策略约束的运行时内运行。
这种方案与将运行时视为执行层启动后可按需调用的普通工具有本质区别——智能体可以选择不调用的控制,不是有效的安全控制。
常见安全缺陷
许多智能体架构存在同一根本缺陷:授权决策可能受到智能体本身或其读取的不可信数据的影响,具体表现为以下几类:
边界不清晰:规则分散于提示词、模型、智能体、执行层、运行时和基础设施中,难以确定权威版本。
过度授权:智能体获得长期有效的凭据或超出当前任务所需的权限。
不可信数据充当控制信号:文档、消息、工具输出结果和记忆内容可能在未经授权的情况下改变智能体行为。
不受控制的外部效果:被允许的API调用可能在预期控制范围之外移动数据、创建计算资源或触发其他效果。
故障级联扩散:智能体之间存在委派、共享记忆和相互调用关系,一处失误可能迅速引发连锁反应。
审计证据不完整:审批记录模糊,访问撤销不及时,事件记录不足以支撑事故分析或恢复操作。
五条核心设计原则
以下五条设计原则有助于将安全决策置于智能体的控制范围之外。
上层提议,下层决策:模型、智能体、执行层、工具或记忆系统均不得自行授予自身权限。
策略位置权威化:策略应位于安全边界以下。边界以上的策略感知规划有其价值,但仅作为参考建议。
检查每一项效果:对所有文件操作、进程调用、网络请求、API调用、数据操作、资源分配、通信行为和设备操作实施全面管控。
即时访问授权:凭据和能力应保持范围最小、有效期最短,且易于撤销。
隔离与恢复机制:隔离每个智能体,快速撤销访问权限,完成恢复操作,并保存完整记录。
风险等级与安全控制强化
所有风险等级的智能体均采用相同的架构、边界和接口,但根据授权级别、潜在影响和对抗行为的可能性,施加不同程度的控制。随着智能体获得更大权限、其行动潜在影响不断扩大,需要在五个方面强化控制:
授权范围收窄:风险越高,授权的有效期应越短。
更频繁的决策刷新:在每次操作前更及时地重新评估策略。
更强的监督机制:对高影响工作引入实时监督。
更快的恢复能力:预先规划访问撤销、隔离和回滚方案。
独立的证据体系:在安全边界以下保存不可篡改的操作记录。
跨风险等级的通用安全要求
尽管不同风险等级的控制力度存在差异,以下安全要求在所有场景下必须始终保持一致:
智能体不得自行授予自身访问权限:控制措施在智能体进程之外执行,且不受智能体控制,在任何级别均不例外。
所有在范围内的高影响效果必须经过执行点:检查在执行操作的系统中完成。
系统必须具备安全失败能力:当控制缺失或过期时,系统应自动选择预先批准的更安全状态。对于物理系统和可用性关键系统,该状态可能是受控运行而非骤然停机。
安全声明应保持范围明确:明确说明所覆盖的具体路径、所做的假设以及排除在外的情况。
参与共建
无论您是从事AI模型开发、AI系统部署、云基础设施运营、安全研究,还是从事治理与标准制定工作,您的实践经验都有助于推动AI社区从安全事件中持续学习:探索NVIDIA OpenShell,了解安全私有运行时如何隔离自主智能体并执行安全策略;参阅并贡献Open Secure AI Alliance发布的共享AI发现交换(SAFE)提案,该框架旨在构建社区机制,以便从AI事件和险情中系统性地汲取经验。
Q&A
Q1:ARC-AGI-3基准测试是什么?NVIDIA是如何在上面取得满分的?
A:ARC-AGI-3是一项交互式推理基准测试,它将智能体置于完全陌生的环境中,不提供任何指令、明确规则或既定目标,专门考察智能体在无先验知识条件下的推理能力。NVIDIA研究人员借助智能体变异算子(AVO)技术,在该基准上取得了100%的满分成绩。AVO的核心思路是通过系统性地对智能体的行为策略进行变异与组合,帮助智能体探索更广泛的解题路径,从而在结构不明确的复杂任务中实现突破。
Q2:为什么说执行层不适合作为安全保证的核心层级?
A:执行层在设计上是高度可编程的,支持插件替换和行为组合,这使其难以对自身修改实施可靠的防护。更根本的问题在于,依赖执行层逻辑来保障安全,本质上是对模型行为的假设性编码,而模型能力会持续演进,这些假设会随之失效。此外,执行层的控制能否生效,最终取决于模型是否按预期行动。因此,真正权威的安全控制必须下沉至基础设施层,由环境本身来决定智能体能做什么,而非仅靠软件逻辑引导智能体去做什么。
Q3:NVIDIA OpenShell是什么?它如何保护AI智能体的安全?
A:NVIDIA OpenShell是一种安全私有运行时环境,专为隔离自主AI智能体并执行安全策略而设计。其核心机制是在智能体启动时即建立安全边界:编排器通过OpenShell创建运行时并配置治理策略,执行层及其所有插件、工具和子进程均在该边界内运行。子智能体只能获得有上限约束的委派权限,无法突破上限自行扩权。这种架构确保安全控制处于智能体的控制范围之外,智能体无法选择性地绕过或拒绝执行安全检查。
