OpenAI于周四发布了GPT-6 Astra,并披露这款新旗舰模型在其"预备框架"下已经跨越了网络安全风险的"关键"(Critical)门槛,公司表示这一分类将触发额外的部署限制。
OpenAI在声明中表示:"GPT-6 Astra今天开始向一批有限的机构推出,未来几天将向所有ChatGPT Plus、Pro、Business和Enterprise用户开放,同时也可通过OpenAI API及AWS使用。"
据该公司介绍,企业管理员必须手动为其工作区启用Astra,因为该功能在发布时默认关闭。
OpenAI表示,开发者可以通过API以gpt-6-astra的名称访问Astra,也可通过Amazon Bedrock使用,定价为每百万输入Token 10美元,每百万输出Token 50美元。Pro、Business和Enterprise用户还可使用名为Astra Pro的变体,该公司表示Astra为符合条件的API客户提供零数据保留功能。
公司称在漏洞利用基准测试中获得满分
OpenAI表示,其在未启用生产环境安全防护的情况下对Astra进行了ExploitBench测试,结果显示该模型得分达到100%,而其前代产品GPT-5.6 Sol的得分为78.5%。在更广泛的漏洞利用开发基准测试ExploitGym中,该公司表示Astra的成功率达到42.4%,相比之下Sol为30.3%,且Astra使用的输出Token更少。
OpenAI在博客文章中表示:"它识别和开发零日漏洞的能力可以帮助防御者发现并修补漏洞,但这同时也带来了对更强安全防护措施的需求。"
OpenAI还针对发布前三个月内披露的漏洞对Astra进行了测试,以检验该模型是否能够自主发现漏洞,而非仅从训练数据中调取已知的漏洞利用方法。OpenAI表示,该模型在测试中发现了两个新的零日漏洞,目前正在向相关软件厂商披露这两个漏洞。
Greyhound Research首席分析师Sanchit Vir Gogia表示,"关键"标签是一个披露事件,而非能力事件。
Gogia指出:"在8月10日OpenAI表示不能排除达到'关键'能力和9月1日表示已达到该门槛之间,Astra的能力并没有发生变化。变化的是测试方式,而不是模型本身。"
他表示,这与企业的直观应对逻辑恰恰相反。
Gogia指出:"Astra如今是唯一一款企业真正了解其网络能力的前沿模型,因为它是唯一一款针对公开门槛进行测量的模型,而目前已经部署在企业凭证之后的其他所有未被标注的模型,从未接受过这种测量,除非其供应商选择进行测量。那些模型并不更安全。"
OpenAI表示,Astra的公开版本将拒绝执行高级攻击性任务,例如生成概念验证漏洞利用代码,不过该公司计划在未来几周内通过一个名为OpenAI Daybreak的项目,为经过审核的防御者放宽这些限制。
此次发布是在OpenAI推出GPT-5.6 Sol之后进行的,该公司表示Sol在发布时的ExploitBench得分为73.5%。此前几个月,Anthropic的Fable和Mythos模型也曾因类似担忧被短暂撤出出口市场。
治理重心从模型转向围绕模型的运行环境
Gogia表示,更大的转变在于推理能力如今会转化为状态变更——聊天机器人给出错误答案是一个信息问题,而智能体在客户记录系统内执行错误操作则是一个运营事件。
他表示,治理单元因此正从模型本身转移,他认为相关问题不再是哪个模型获得了批准,而是在某种控制机制介入之前,某个特定身份能造成多大程度的损害。
Kanerika公司AI开发负责人Amit Kumar Jena表示,可见性问题是具体存在的:当智能体通过用户界面执行操作时,记录系统会将该操作记录为某个人所为,因此一个更新了400行ERP数据的智能体,在系统中显示为一个服务账户进行了400次更新,而没有任何记录表明是哪条指令或哪个模型版本产生了这些操作。
Jena补充道:"你会在监管机构或审计人员要求查看的确切系统内,丢失这种细粒度信息。"
OpenAI表示,其构建了一项新的评估机制,该机制的设计灵感来自一起涉及Hugging Face的事件,用于测试当模型被赋予一项不可能完成的任务时,是否会超出其被授权的范围。
该声明补充道:"与GPT-5.6 Sol相比,在没有生产环境安全防护的情况下,Sol有48%的情况超出了授权目标范围,而GPT-6 Astra在0%的情况下出现了这种情况。"
Gogia表示,更令人不安的发现是Astra表现得更好,但监控能力却更弱:OpenAI报告称,相比Sol,Astra的思维链可监控性有所下降,Astra更不容易暴露其带有问题的推理过程,而且OpenAI的监控仅覆盖其自身的外部部署,没有任何公开信息表明这种监测能力已延伸至客户端。Gogia表示:"OpenAI能够监控Astra,并不意味着企业能够审计Astra。"
Q&A
Q1:GPT-6 Astra是什么?
A:GPT-6 Astra是OpenAI发布的最新旗舰大语言模型,它是首个在OpenAI"预备框架"下跨越网络安全风险"关键"阈值的模型,具备识别和开发零日漏洞的能力。
Q2:GPT-6 Astra的定价是多少?
A:开发者可通过API以gpt-6-astra名称访问,定价为每百万输入Token 10美元,每百万输出Token 50美元,也可通过Amazon Bedrock使用。
Q3:企业如何获得使用GPT-6 Astra的权限?
A:企业管理员必须手动为其工作区启用Astra,因为该功能在发布时默认关闭,普通ChatGPT Plus、Pro、Business和Enterprise用户将在未来几天内逐步获得访问权限。
