
随着一年一度 Black Hat 大会于今日在拉斯维加斯开幕,目前拥有 120 多家成员机构的开放安全 AI 联盟正在制定新的指南,以加强代理式 AI 的网络安全。
Linux 基金会今日发布了一份关于共享 AI 发现交换 (SAFE) 的征求意见稿,这套指南旨在将智能体网络安全事件转化为惠及整个生态系统的共享防护机制。
SAFE 指南正在由开放安全 AI 联盟的工作组负责起草。NVIDIA、Cisco、CrowdStrike、Hugging Face 和 Red Hat 等开放安全 AI 联盟成员正在与 Linux 基金会合作,为初始提案做出贡献。
SAFE 指南包括以下建议:保密收集和分析 AI 安全事件和未遂事件、通知受影响方、识别重复出现的管控失效问题,并发布基于证据的操作建议以降低系统性风险。
网络安全是一场没有终点线的竞赛。每一次重大技术变革都会产生新的潜在攻击面。防御者现在必须以智能体的速度采取行动,才能快速响应以保护基础设施和知识产权 —— 而实现这一目标的最佳方式就是合作。当可信赖的生态系统公开共享威胁情况时,集体防御就成为一种力量倍增器。
开放安全 AI 联盟为 AI 网络安全提供更多工具
SAFE 框架是开放安全 AI 联盟成员所做技术贡献的进一步延伸,旨在构建和共享涵盖整个 AI 安全技术栈的开放、可检查的工具。
AI 智能体不仅仅是一个模型。它是一个系统 —— 包括身份认证、Harness、安全护栏、日志和评估 —— 确保其安全需要的不止是漏洞扫描。
安全一直以来都在层层防御中最为坚固,同时也依赖于社区分享其所知的意愿。当防御者以开放和快速的方式相互学习时,棘手的问题就能迎刃而解。
开放的 NVIDIA 网络安全软件与模型全栈
NVIDIA 的贡献贯穿整个技术栈,首先是发布在 GitHub 上的 NVIDIA Labs Object-Oriented Agent (NOOA) 研究 Harness —— 这使得智能体行为更容易被测试、追踪、审计和治理。
NVIDIA OpenShell 运行时限制了智能体所能查看、接触和执行的操作 —— 在智能体层强制执行安全和隐私管理,从而使智能体无法接触到它不应该访问的内容。
NVIDIA 的开放模型系列 —— 用于代理式 AI 的 NVIDIA Nemotron、用于物理 AI 的 NVIDIA Cosmos、用于机器人的 NVIDIA Isaac GR00T、用于医疗和生命科学的 NVIDIA BioNeMo,以及支持商用部署的辅助驾驶模型 NVIDIA Alpamayo —— 其模型权重、数据集和训练方法均以开放形式提供。
NVIDIA 开源且经过验证的智能体技能将这种信任扩展到了能力层。
每项技能都提供可移植的指令集 —— 这些指令集经过分类,扫描了例如提示词注入和工具中毒的风险,进行了加密签名,并附有技能卡记录。防御者可以确切地知道一项智能体技能的作用、来源以及发布后是否被修改过。
NeMo Guardrails、NeMo Anonymizer 和 NeMo Safe Synthesizer 可帮助执行安全策略、保护敏感数据并生成隐私安全的合成数据。
此外,NVIDIA 的开源 LLM 漏洞扫描器 Garak,允许安全团队在模型发布之前检查其是否存在数据泄露、提示词注入和越狱场景。
联盟成员扩展开放生态系统开发工具
开放安全 AI 联盟的其他成员也在整个完整的防御技术栈上进行构建,涵盖身份认证与权限、Harness、运行时安全护栏、安全 AI 模型、可观测性与评估、数据安全与隐私、可用性与弹性等方面。
以下重点介绍了技术栈不同层面的最新贡献,更多贡献正在陆续推出。
身份认证与权限 —— 谁来采取行动
您无法保护您无法识别的内容。
Okta 正在开发智能体身份认证与访问的参考实现,展示了开放协议 Cross App Access (XAA) 如何使在 OpenShell 沙盒环境中运行的 AI 智能体安全地连接到企业应用。
Palo Alto Networks 贡献了来自其下一代身份认证安全平台 Idira 的开源工具,包括 Agent Guard 和 Agent Watch。这些工具可帮助开发者和智能体开发者应用身份认证安全出色实践和安全防护措施,例如为智能体工作流安全地检索密钥。
Red Hat 创建了一个新的开源项目 asago,将组织的自定义治理要求 (例如 NIST、OWASP 和《欧盟 AI 法案》中提及的要求) 直接映射到智能体在运行时被允许执行的操作上,并提供从策略条款到实时管理的单一审计追踪。
Harness 与工具 —— 如何编排安全工作
AI 智能体不仅仅是一个模型 —— 它们利用开放和闭源模型、Harness、工具和运行时的系统来完成工作。
如果模型是智能体的大脑,那么 Harness 就是智能体通过使用工具采取行动的身体。围绕模型的 Harness 就像一个编排器,它决定了智能体如何被部署、协调和约束。
联盟成员正在为 AI 安全技术栈的这一新兴层贡献工具、Harness 和支持技术。
今日成为开放安全 AI 联盟的最新成员之一的 Amazon 贡献了 Strands Agents,这是一个用于构建 AI 智能体的开源工具包,在各层均保持开放,使开发者能够全面了解智能体行为,并能够在生产环境中评估智能体系统。Amazon 还贡献了 Cedar,这是一种开源授权语言,可强制执行 AI 智能体被允许执行的操作的确定性、可验证的边界,为客户提供细粒度、可分析的访问管理,以帮助确保只有经过授权的操作才能访问企业资源。
Capital One 开源了 VulnHunter,用于代理式 AI 的代码安全。
Cloudflare 正提供其 Vulnerability Discovery Harness 作为一项开源技能,用于为智能体系统增添安全性。
Microsoft AI Red Team 已开源了多款工具和 Harness。PyRIT (Python Risk Identification Toolkit) 使 AI 红队人员能够运行自动化的红队测试,内置记忆功能,支持常见目标和自定义端点。
RAMPART 将红队发现的问题和现实世界中的事件转化为可重复的测试,这些测试会随着软件的变更而运行。Clarity 帮助团队在编写代码之前质疑设计假设并识别潜在的失败。
Microsoft 还开源了 Assert,将自然语言需求和预期的 AI 安全与防护行为转化为可执行的评估。
Wiz 的自主漏洞研究引擎 Atlas 可协调专用 AI 智能体,以发现并验证代码和开源软件包中的安全缺陷。
Visa 也加入了开放安全 AI 联盟,贡献了其开源的 Visa Vulnerability Agentic Harness,以帮助团队快速、安全地识别问题,并支持修复和验证工作。
模型 —— 专为 AI 安全与防御打造的智能
并非每个安全或防护任务都需要通用模型。专用的安全与防护模型是专为防御而构建的:它们经过训练,能够理解代码、定位漏洞并规模化对威胁进行推理。它们可以作为模型系统来支持智能体工作流,开放和闭源模型协同工作以高效完成任务。
Cisco DefenseClaw 是一个开源智能体治理层,位于 NVIDIA OpenShell 之上,在规模化部署智能体时,它可在运行时层提供强大的自动化安全保障。Cisco 还发布了两款 Antare 安全小语言模型,帮助精确定位代码库中已知漏洞的位置;以及 Project CodeGuard,用于将“默认安全实践”直接嵌入到 AI 编码工作流中。
CrowdStrike 正在为网络防御微调 NVIDIA Nemotron Nano 模型。内部测试在 Falcon LogScale 中的调查查询时达到了 96% 的准确率,提供了一个自然语言界面,可提高智能体的调查效率。CrowdStrike 还发布了一项研究,展示了专门的 NVIDIA Nemotron Nano 推理模型如何在安全运营中心检测分类方面优于更大规模的模型,同时引入基于 logit 校准的置信度,以实现可衡量、可调节和可审计的自主安全决策。
Mistral 今日在 Apache 2.0 协议下,以开放权重的形式发布了其全新 Shieldstral 多模态安全分类器模型。
看到智能体做了什么只是全貌的一部分。防御者还需要了解 AI 采取行动的原因、系统是否安全运行以及攻击在现实世界中的演变方式。
Akamai 带来了其《互联网现状报告》以及《安全智能组研究》的洞察,利用现实世界的数据阐述了 AI 时代面临的威胁,并解释了新兴漏洞的运作方式,以便防御者能够学习、适应和应对。Cognition 发布了一项可信度评估,用于衡量开源衍生模型的契合度和安全风险。该评估表明,可以通过后训练来缓解这些风险。
Perplexity 的 Numbat 是面向客户端端点的开源智能体安全套件。它可以检测、调查和阻止 macOS、Linux 和 Windows 上的智能体活动 —— 为防御者提供智能体实际操作的结构化记录。
Uber 开源了 ADR (Agentic AI Detection and Response) 的关键组件,这是一个生产系统,可重建 AI 智能体活动的完整因果链 —— 从提示词到推理、工具调用和结果 —— 以帮助安全团队检测威胁。如今,ADR 每天支持 30,000 个端点上的超 200,000 次智能体会话,采用双层分析方法,将高效检测与对高置信度威胁的深入调查相结合。
可用性与弹性 —— 在关键时刻实现快速恢复
智能体系统必须在受到干扰时保持可靠、管理故障范围,并在不丢失关键状态或暴露更广泛的环境的情况下安全恢复。
LangChain 正在为其开源框架 (Deep Agents、LangGraph 和 LangChain) 添加弹性功能 —— 使智能体能够重试中断的工作,遵循安全恢复路径,从保存的状态恢复而不是重新开始,并在主模型出现故障时自动回退到备用模型。
Veeam 通过例如 Kanister (其用于 Kubernetes 数据保护的开源框架) 等技术帮助组织保持 AI 背后的数据和基础设施具有弹性和可恢复性。它可帮助团队保护 AI 工作负载、向量数据库和数据,并将其恢复到经过验证的已知良好状态。

更多贡献正在持续推出。当成员发布可复用的缓解措施时,整个生态系统中的防御者都可以对其进行检查、调整和改进,从而帮助安全实践随着 AI 的进步而演进。
