开放安全AI联盟目前已有逾120家成员组织,正值一年一度的Black Hat大会在拉斯维加斯开幕之际,该联盟正积极制定新的准则,以强化智能体AI的网络安全能力。
Linux基金会近日发布了《共享AI发现交换》(Shared AI Findings Exchange,简称SAFE)征求意见稿。这套拟议准则旨在将智能体网络安全事件转化为对整个生态系统的共同防护。
SAFE准则由开放安全AI联盟工作组负责起草,英伟达、思科、CrowdStrike、Hugging Face和红帽等成员与Linux基金会携手参与了初始提案的贡献工作。
SAFE准则提案涵盖以下几个核心方向:以保密方式收集和分析AI事件及未遂事故、通知受影响方、识别反复出现的控制漏洞,以及发布基于证据的操作建议,从而降低系统性风险。
网络安全是一场没有终点的竞赛。每一次重大技术变革都会催生新的潜在攻击面。防御者必须立即以智能体的速度行动,才能快速保护基础设施和知识产权。而实现这一目标的最佳方式,就是协同作战。当可信生态系统开放共享威胁情报时,集体防御的效能将成倍增长。
SAFE框架是开放安全AI联盟成员在全AI安全栈上构建和共享开放、可检查工具所作技术贡献的重要组成部分。
一个AI智能体不仅仅是一个模型,它是一个系统——包含身份控制、运行框架、安全护栏、日志和评估机制。保障其安全,远不止漏洞扫描那么简单。
安全性始终在层次化架构和社区共享意愿中得到最大强化。当防御者彼此开放地、快速地相互学习,最棘手的问题才能迎刃而解。
英伟达的贡献贯穿整个技术栈,起点是发布于GitHub上的英伟达实验室面向对象智能体(NOOA)研究框架,该框架使智能体行为更易于测试、追踪、审计和治理。
英伟达OpenShell运行时限制了智能体的可见范围、可操作对象及可执行动作,在智能体层面强制执行安全和隐私控制,防止智能体访问其无权触及的内容。
英伟达旗下的开放模型家族——面向智能体AI的NVIDIA Nemotron、面向物理AI的NVIDIA Cosmos、面向机器人的NVIDIA Isaac GR00T、面向医疗健康与生命科学的NVIDIA BioNeMo,以及全球最大的获许商用自动驾驶模型NVIDIA Alpamayo——均提供开放权重、数据集和训练技术。
英伟达开源的经验证智能体技能将这种信任延伸至能力层。每项技能提供可移植的指令集,经过分类整理、风险扫描(如提示注入和工具投毒),并附有加密签名和技能卡文档说明。防御者能够清楚地了解某项智能体技能的功能、来源,以及发布后是否曾被修改。
NeMo Guardrails、NeMo Anonymizer和NeMo Safe Synthesizer分别用于执行安全策略、保护敏感数据和生成保护隐私的合成数据。
Garak是英伟达开源的大语言模型漏洞扫描工具,可帮助安全团队在模型上线前检测数据泄露、提示注入和越狱等安全风险。
其他开放安全AI联盟成员也在全防御技术栈上积极布局,覆盖身份与权限、运行框架、运行时护栏、安全AI模型、可观测性与评估、数据安全与隐私、可用性与弹性等多个层次,持续贡献新成果。
身份与权限
"无法识别,便无从防护。"
Okta正在开发智能体身份与访问的参考实现,展示跨应用访问(XAA)这一开放协议如何使在OpenShell沙盒环境中运行的AI智能体安全连接企业应用程序。
Palo Alto Networks贡献了来自其下一代身份安全平台Idira的开源工具,包括Agent Guard和Agent Watch,帮助开发者和智能体构建者应用身份安全最佳实践,例如在智能体工作流中安全获取密钥。
由红帽发起的新开源项目asago,可将组织的自定义治理要求(如NIST、OWASP和欧盟AI法案中的相关规定)直接映射到智能体在运行时允许执行的操作,并提供从政策条款到实时控制的统一审计跟踪。
框架与运行时
AI智能体不止于模型本身,它还依托开放与封闭模型、运行框架、工具和运行时系统的协同运作来完成任务。
如果说模型是智能体的大脑,运行框架便是通过工具付诸行动的躯体,它围绕模型发挥调度作用,决定智能体如何被部署、协调和约束。
联盟成员正在这一新兴的AI安全栈层贡献工具、框架和配套技术。
亚马逊今日正式成为开放安全AI联盟最新成员之一,贡献了Strands Agents——一个构建AI智能体的开源工具包,在每个层次都保持开放,赋予开发者对智能体行为的完整可见性,并支持在生产环境中评估智能体系统。亚马逊还贡献了Cedar,一种开源授权语言,通过确定性、可验证的边界规范AI智能体的行为,为客户提供细粒度、可分析的访问控制,确保只有经授权的操作才能访问企业资源。
Capital One开源了面向智能体AI代码安全的VulnHunter工具。
Cloudflare将其漏洞发现框架作为开源技能贡献,为智能体系统增添安全能力。
微软AI红队开源了多款工具和框架。PyRIT(Python风险识别工具包)支持AI红队运行自动化红队测试,内置记忆功能,兼容常见目标及自定义端点。RAMPART将红队发现和真实事件转化为随软件变更自动执行的可重复测试。Clarity帮助团队在代码编写前质疑设计假设、识别潜在缺陷。微软还开源了Assert,可将自然语言需求及预期的AI安全行为转化为可执行的评估项目。
Atlas是Wiz的自主漏洞研究引擎,通过编排专业AI智能体,在代码和开源包中发现并验证安全缺陷。
Visa也已加入开放安全AI联盟,贡献了其开源的Visa漏洞智能体框架,帮助团队快速、安全地识别问题、支持修复和验证工作。
安全与安全模型
并非每项安全任务都需要通用模型。专用安全模型专为防御而生:经过训练,能够理解代码、定位漏洞并大规模推理威胁。它们可作为模型系统支撑智能体工作流,以开放与封闭模型协同的方式高效完成任务。
思科DefenseClaw是一个开源智能体治理层,运行于英伟达OpenShell之上,在扩展智能体规模时提供强健的自动化运行时安全保障。思科还发布了两款Antares安全小语言模型,用于精准定位代码库中的已知漏洞;Project CodeGuard则将安全默认实践直接嵌入AI编码工作流。
CrowdStrike正在对英伟达Nemotron Nano模型进行网络防御领域的微调。内部测试显示,该模型在Falcon LogScale中生成调查查询的准确率高达96%,提供了自然语言接口,显著提升智能体调查效率。CrowdStrike还发布了研究成果,证明经过专门调优的英伟达Nemotron Nano推理模型在安全运营中心检测分类任务上的表现超越了规模大得多的模型,同时引入经过校准的基于logit的置信度机制,实现可量化、可调节、可审计的自主安全决策。
Mistral今日以Apache 2.0协议开源发布了其全新的Shieldstral多模态安全分类器模型。
可观测性与评估
了解智能体的行为只是全貌的一部分,防御者还需要理解其行为动机、系统是否安全运行,以及现实世界中攻击手法的演变趋势。
Akamai借助其互联网现状报告和安全情报组的研究成果,基于真实世界数据揭示AI时代的威胁态势,解析新兴漏洞利用手法,助力防御者学习、适应和响应。Cognition发布了一项可信度评估,用于衡量开源衍生模型的对齐性和安全风险,并证明这些风险可通过训练后处理加以缓解。
Numbat是Perplexity面向客户端的开源智能体安全套件,可在macOS、Linux和Windows上检测、调查和阻止智能体活动,为防御者提供智能体实际行为的结构化记录。
Uber开源了ADR(智能体AI检测与响应)的核心组件,这是一套生产级系统,可重建AI智能体活动的完整因果链——从提示词到推理过程、工具调用再到最终结果——帮助安全团队检测威胁。目前,ADR每天跨30,000个端点处理超过20万个智能体会话,采用两级分析方法,将高效检测与针对高置信度威胁的深度调查相结合。
可用性与弹性
智能体系统必须在受到干扰时保持可靠运行,能够遏制故障蔓延并安全恢复,同时不丢失关键状态或暴露更广泛的运行环境。
LangChain正在为其开源框架——Deep Agents、LangGraph和LangChain——增添弹性能力,使智能体能够重试被中断的任务、遵循安全恢复路径、从保存的状态恢复而非从头开始,并在主模型失效时自动切换至备用模型。
Veeam通过Kanister等技术帮助组织保持AI相关数据和基础设施的弹性与可恢复性。Kanister是其面向Kubernetes数据保护的开源框架,帮助团队保护和恢复AI工作负载、向量数据库及数据,使其还原至经过验证的已知良好状态。
更多贡献仍在持续涌入。当成员发布可复用的缓解措施时,整个生态系统的防御者都可以检视、改进和优化,推动安全实践随AI发展而不断演进。
欢迎在Black Hat大会期间加入开放安全AI联盟成员的活动,时间为8月4日(周二)太平洋时间下午5:15,地点在曼德勒湾会展中心主舞台外侧、商业展厅区域,进行集体合影。
如需了解更多信息或表达加入开放安全AI联盟的意愿,请访问官方页面进行申请。
Q&A
Q1:SAFE准则是什么?它的主要目标是什么?
A:SAFE(共享AI发现交换)是由开放安全AI联盟工作组起草的一套拟议准则,旨在将智能体网络安全事件转化为对整个生态系统的共同防护。其核心目标包括:以保密方式收集和分析AI事件及未遂事故、通知受影响方、识别反复出现的控制漏洞,并发布基于证据的操作建议,从而降低系统性风险,推动防御者开放共享威胁情报,实现集体防御。
Q2:英伟达在开放安全AI联盟中贡献了哪些具体工具?
A:英伟达的贡献贯穿整个技术栈:NOOA研究框架便于测试、追踪、审计智能体行为;OpenShell运行时限制智能体的访问权限;开源模型家族包括Nemotron、Cosmos、Isaac GR00T、BioNeMo和Alpamayo;开源经验证的智能体技能,附有加密签名和技能卡;NeMo Guardrails、NeMo Anonymizer和NeMo Safe Synthesizer用于安全策略和数据保护;Garak是开源大语言模型漏洞扫描工具。
Q3:除英伟达外,还有哪些企业参与了开放安全AI联盟的贡献?
A:多家企业积极参与贡献:亚马逊贡献了Strands Agents和Cedar;微软AI红队开源了PyRIT、RAMPART、Clarity和Assert;思科贡献了DefenseClaw和Antares安全模型;CrowdStrike对Nemotron Nano进行了网络防御微调;Palo Alto Networks贡献了Agent Guard和Agent Watch;Uber开源了ADR智能体检测响应系统;LangChain为开源框架增添弹性能力;Mistral发布了Shieldstral安全分类器模型。
