OpenAI正在为企业客户新增一项安全能力,允许在不留存提示词或响应内容的前提下,跨多次交互检测AI系统的滥用行为,从而在保障零数据留存(ZDR)承诺的同时实现风险监控。
OpenAI在一篇博客文章中表示,在请求处理完成后,公司不会留存提示词或模型响应内容。这一新系统名为"私密安全处理"(Private Safety Processing),其设计目标是在不向OpenAI员工暴露底层内容的情况下,识别相关交互之间的行为模式。
该功能目前正在符合条件的企业客户和API用户中进行测试,旨在弥补现有安全控制机制的不足——现有机制仅对单次交互进行独立评估,难以发现随时间推移才显现的风险。
私密安全处理的设计思路是对现有安全系统的延伸,通过关联相关交互的活动,而非孤立分析每条提示词,来扩展检测能力。
据OpenAI介绍,在该模式下,自动化系统会对交互内容进行分析,并生成"一个范围严格限定的信号,用于指示所涉及的活动类型",而不会暴露底层的提示词或响应内容。
无论客户数据保存在企业自控基础设施中,还是由OpenAI以客户掌握加密密钥的方式加密存储,该系统均可正常运行。OpenAI表示:"在两种情况下,自动化系统均可识别潜在滥用行为,并返回有限的安全信号,而不会将底层提示词或响应内容暴露给OpenAI员工。"
OpenAI表示,这一新功能旨在填补AI风险检测方面的空白。公司指出:"最严重的AI安全风险并不总是在单次交互中可见",有害意图往往只有在多次交互综合来看时才会显现。
此类风险包括:反复试探安全防护机制、跨账户的协同活动,以及在一系列交互过程中逐渐浮现的滥用行为。OpenAI表示,随着AI系统承担的任务越来越长、越来越复杂,孤立评估单条提示词会限制识别此类模式的能力。
私密安全处理的推出,也凸显了AI服务商在安全策略上的差异。OpenAI表示,该系统旨在跨交互检测滥用模式,同时保持零数据留存。相比之下,部分服务商会在一段时间内留存客户交互数据以支持安全监控,体现了识别跨请求风险的不同路径。
Greyhound Research首席分析师Sanchit Vir Gogia表示,两者的差异在于如何处理证据,而非是否使用信号。"这是一场关于'除了你本就保留的信号之外,还需要多少原始内容'的争论,而非隐私与监控之间的对立。"他补充说,两种方式都依赖衍生指标,区别在于调查数据的存放位置。"Anthropic希望保留足够的内容来调查案例,OpenAI则希望由客户持有案例,服务商持有警报。"
分析师指出,该系统依赖信号而非直接访问数据,改变了企业核实和调查事件的方式。Gogia表示:"这套架构完全可行。安全领域依靠衍生指标运作已有一代人的时间。难点在于核实,而非可行性。"他还指出,跨时间检测行为需要保留某种形式的记录:"一个系统若不能跨时间记住某些内容,就无法检测跨时间的行为。"他表示,私密安全处理"是一种保护隐私的滥用检测机制,并非企业取证记录,OpenAI也没有声称它是"。
Gartner高级首席分析师Apeksha Kaushik认为,这一方式可能影响数据要求严格的行业对AI的采用。"采用零数据留存等隐私保护安全模型,是一种新兴方式,有望降低金融服务、医疗健康等受监管行业采用AI的门槛。"她指出,此类模型"可能有助于组织满足特定隐私要求,并可能与GDPR、HIPAA等框架保持一致,但具体效果取决于实施细节和监管指引"。Kaushik还建议,各组织应结合自身合规要求对此类方案进行评估,并咨询合规和法律团队,以确认其是否满足特定的监管和运营要求。
OpenAI表示,在该模式下,企业对自身数据保有控制权,可使用自有系统对警报进行调查。客户也可选择向OpenAI共享相关数据,以支持调查或申诉流程。
分析师认为,这将责任转移至企业一侧。Gogia表示:"零数据留存并不能消除取证负担,只是将其转移了位置。"
Q&A
Q1:OpenAI的"私密安全处理"功能是什么?它如何在不留存数据的情况下检测滥用行为?
A:私密安全处理是OpenAI推出的一项安全功能,通过自动化系统分析多次交互之间的行为模式,生成有限的"活动类型信号",而不留存或暴露底层的提示词和响应内容。它既可在企业自控基础设施中运行,也支持OpenAI加密存储但客户掌握密钥的场景,从而在零数据留存的前提下实现跨交互的风险检测。
Q2:OpenAI与其他AI服务商在安全数据处理方式上有何不同?
A:主要区别在于证据的存放位置。OpenAI采用信号机制,不留存原始交互内容,由客户自行持有调查所需数据;而部分其他服务商(如Anthropic)会在一定时间内留存客户交互内容,以便在发现风险时进行深入调查。两种方式都依赖衍生指标,但对原始数据的掌控权归属不同。
Q3:私密安全处理功能主要针对哪些类型的AI滥用风险?
A:该功能主要针对那些在单次交互中难以察觉、需要跨多次交互才能识别的风险,包括:反复试探AI安全防护机制的行为、跨账户的协同滥用活动,以及在一系列交互过程中逐步显现的恶意意图。随着AI任务日趋复杂,这类跨时间维度的风险检测需求也愈发突出。
