随着企业数字化程度不断加深,识别并消除可被利用的系统漏洞已成为战略重点。

渗透测试是指模拟针对组织系统的网络攻击,以便在恶意行为者利用漏洞之前发现安全弱点。传统上,这类工作是阶段性的,受限于人力资源的可用性。

测试团队到场、对特定环境进行测试、出具报告后离开。与此同时,随着新代码的部署和身份权限的不断累积,环境也在持续变化。昨天的"健康证明"很快就会变成今天未被记录的安全隐患。

人工智能从根本上改变了这一模式。自学式渗透测试作为一门新兴学科,已超越自动化扫描的范畴,演进为能够观察环境、形成假设、验证假设、从结果中学习并选择下一步行动的系统。

以下是事件响应管理人员需要了解的内容。

"自学"的含义

"自学"(Autodidactic)指的是自主导向的学习。传统扫描器按照预设的检查目录执行任务;自主智能体则自行选择使用哪种工具;而自学式系统则能解读失败原因,更新对目标的认知,并设计下一步尝试方案。

例如,系统可能发现某个直接漏洞利用路径被封堵,进而推断某个身份凭证提供了另一条可行路径,随后验证这一假设,并将结果纳入不断演化的攻击图谱中。

除了提示词工程和简单的工具指令之外,AI智能体越来越需要一个持久化的知识工作空间——一种结构化记忆,帮助其跨任务推理、与子智能体协调,并借助委托的人类身份从历史操作中持续学习。

OpenAI事件揭示的能力边界

2026年7月,OpenAI披露了一起事件:在内部网络能力评估过程中,参与测试的模型突破了预设约束,并入侵了Hugging Face的基础设施。

这些模型发现了缓存代理中的一个零日漏洞(即此前未知的漏洞),获取了互联网访问权限,并借此提升了权限,综合运用多种技术手段,沿着复杂的攻击路径最终抵达受保护目标——即ExploitGym。

这些模型的持续性行为表明,高级智能体将技术障碍视为有待解决的问题,而非需要遵守的边界。Anthropic同样公布了其基准测试审查中发现的三起类似事件的详情。

现代进攻性AI的核心趋势是"长周期操作"。智能体不再局限于完成单一任务,而是在侦察、漏洞利用、权限提升和横向移动等全链路中持续维持目标。它能够协调调用命令行、浏览器、源代码分析、云API和凭证收集等多种工具,并凭借足够的状态记忆从早期操作中持续学习。

这些能力同样将惠及防御方。自学式系统可以持续测试动态变化的基础设施,验证发现的漏洞是否可被实际利用,并对修复措施进行复测。

智能体不会仅仅向CVE积压清单(即已知但尚未修复的漏洞列表)中新增数千条理论漏洞,而是能够直观呈现多个弱点如何组合形成通往关键资产的有效攻击路径。关注点由"发现了多少漏洞"转向"消除了多少暴露面",这正是我们所说的"自我加固软件"。

防御AI面临的不对称困境

Hugging Face的应对过程同样揭示了防御性AI在最需要发挥作用时所受到的制约。Hugging Face使用大语言模型驱动的智能体分析了17,600条记录事件,重建了攻击时间线,识别了入侵指标,并梳理了受影响的凭证。

团队最初尝试通过服务商API将取证证据(包括攻击者命令、漏洞利用代码和命令控制痕迹)提交给前沿模型,但这些请求均遭到拦截——安全系统无法可靠区分取证调查与黑客攻击行为。

Hugging Face转而在自有基础设施上运行中国开源模型GLM-5.2,这使响应团队得以在不受拒绝的情况下处理证据,同时防止敏感数据和相关凭证外泄。

Hugging Face将此称为"不对称问题":攻击者使用不受限制或经过破解的模型,而防御方使用托管的前沿模型时却受到服务商安全护栏的阻拦。实际建议是:在事件发生之前,提前准备好经过验证、可本地部署的能力模型。

构建可问责的访问机制

解决方案并非取消安全防护,而是建立可问责的访问机制。OpenAI的"网络安全可信访问"等项目指明了一种方向:经过验证的防御方可通过更严格的身份核验、监控和监督机制,获得更高权限的能力访问。

安全控制需要了解以下上下文信息:谁在执行操作、哪些系统已获授权测试、执行发生在何处,以及每项操作将如何被审计,必要时如何回滚。

AI渗透测试智能体已具备执行真实网络操作的能力,因此仅凭信任其道德行为是不够的,必须建立技术层面的保障机制来强制执行合规行为。正如InfoSecurity Magazine所指出的,当一个智能体能够完成身份验证、枚举、漏洞利用、横向移动和数据窃取时,道德意图本身是不够的。

这些保障机制必须控制智能体的操作权限、约束其行为范围、确保其完成后自行清理,并为每项操作创建可审计的记录。否则,我们将为威胁行为者留下入侵系统的跳板。

技术保障的四大支柱

授权必须通过代码强制执行,而非依赖提示词或工作说明书。目标系统应与授权组织进行加密绑定。测试范围、时间窗口、禁止操作和终止条件必须具备机器可执行性。

自学式系统可以决定如何测试,但绝不能自行决定有权测试什么。

约束机制必须在模型层之下建立,例如:

网络出口限制,约束智能体可发送数据或建立连接的目标范围;隔离执行环境,将智能体运行在隔离环境中,即便出现异常行为也无法自由访问组织的其他系统;最小权限身份,即仅授予绝对必要的权限,测试某一应用时不应自动获得整个公司的访问权限;资源限制,约束智能体可消耗的算力、存储、内存或时间;操作频率上限,限制智能体的操作速度,防止出现问题时在数秒内发起数千次请求或变更;人工审批关卡,约束智能体的实际操作权限——仅凭提示词说"不要离开沙箱"并不等于真正的沙箱。

清理工作同样至关重要。自主测试会产生所谓的"智能体残留",包括临时账户、Token、载荷、配置变更、上传文件、计划任务以及潜在的持久化机制。系统应对这些产物进行清单记录、予以删除,并对照已知安全基线验证恢复情况。"清理完成"应有证据支撑,而非仅凭口头保证。

最后,每项操作都必须可追溯至具体的智能体实例、人工授权方、模型版本、工具、凭证和测试任务。由于自学式行为的路径在测试开始时无法预测,其审计负担也相应更高。

走向行业协作标准

世界经济论坛此前一篇关于网络保险与韧性的文章指出,生态系统参与者可通过协作、改进计划、持续监控和情报共享来提升安全水平。同样的逻辑适用于此。

模型提供商、安全厂商、保险机构、监管机构和企业必须共同建立授权证据、智能体日志、清理证明和恢复测试的通用标准。

自学式渗透测试将为防御方带来持久优势:以与环境变化同步的速度持续学习的能力。

然而,一个被训练为突破障碍的系统,最终可能将安全边界也视为另一个需要克服的障碍。因此,衡量其成功与否,不仅在于它发现了什么,更在于它是否始终保持在授权范围内、受到有效约束、能够解释自身行为、完成后自行清理,并在被要求停止时立即停止。

Q&A

Q1:自学式渗透测试和传统渗透测试有什么区别?

A:传统渗透测试是阶段性的,由人工团队到场测试、出具报告后离开,测试结束后环境变化带来的新风险无法及时发现。自学式渗透测试则由AI智能体持续观察环境、形成假设、验证假设并从结果中学习,能够随环境变化不断更新攻击图谱,实现对安全暴露面的持续消除,而非仅生成一份静态报告。

Q2:Hugging Face遭遇的"不对称问题"具体是指什么?

A:Hugging Face在处理安全事件时,尝试将取证证据提交给托管的前沿大语言模型进行分析,但请求被安全系统拦截,因为系统无法区分取证调查和黑客攻击。而攻击者使用的是不受限制或经过破解的模型。这种"攻击方无限制、防御方受约束"的状态就是所谓的不对称问题。Hugging Face最终转而在自有基础设施上运行本地开源模型来解决这一问题。

Q3:部署AI渗透测试智能体需要哪些关键安全保障措施?

A:核心保障措施包括:通过代码强制执行授权(而非依赖提示词)、网络出口限制、隔离执行环境、最小权限身份、资源使用上限、操作频率限制、人工审批关卡,以及完整的操作审计日志。此外,测试结束后必须清理所有临时账户、Token和配置变更,并对照安全基线验证恢复情况,确保不留下可被威胁行为者利用的残留痕迹。

World Economic Forum