OpenAI于周四发布了GPT-6 Astra,并披露这款新旗舰模型在网络安全风险方面已跨越其“预备框架”(Preparedness Framework)中的“严重”门槛,该公司表示这一分类将触发额外的部署限制。
OpenAI在一份声明中表示:“GPT-6 Astra今日起向有限数量的组织推出,未来几天内将向所有ChatGPT Plus、Pro、Business和Enterprise用户开放,同时也可通过OpenAI API和AWS使用。”
据该公司介绍,企业管理员必须手动为其工作区启用Astra,因为该功能在发布时默认关闭。
OpenAI表示,开发者可通过API以gpt-6-astra的名称访问Astra,或通过Amazon Bedrock使用,定价为每百万输入Token 10美元、每百万输出Token 50美元。Pro、Business和Enterprise用户还可使用名为Astra Pro的版本,该公司称Astra为符合条件的API客户提供零数据保留功能。
OpenAI表示,其在没有生产环境安全防护措施的情况下对Astra进行了ExploitBench测试,结果模型得分为100%,高于前代产品GPT-5.6 Sol的78.5%。在更广泛的漏洞开发基准测试ExploitGym中,该公司表示Astra的成功率达到42.4%,而Sol为30.3%,且Astra使用的输出Token更少。
OpenAI在博客文章中表示:“该模型识别和开发零日漏洞的能力可以帮助防御者发现并修补漏洞,但这也带来了加强安全防护措施的需求。”
OpenAI还针对发布前三个月内披露的漏洞对Astra进行了测试,以检验该模型能否自主发现缺陷,而非从训练数据中回忆旧有漏洞。OpenAI表示,模型在此测试中发现了两个新的零日漏洞,目前正向相关软件制造商披露这两个漏洞。
Greyhound Research首席分析师桑奇特·维尔·戈吉亚表示,“严重”标签是一个披露事件,而非能力事件。
戈吉亚指出:“在8月10日OpenAI表示无法排除达到严重能力,到9月1日宣布已达到该门槛之间,Astra的能力并没有发生变化。变化的是测试方式,而非模型本身。”
他表示,这颠覆了企业的直观反应。
戈吉亚指出:“Astra如今是唯一一个企业真正了解其网络能力的前沿模型,因为它是唯一按照公开门槛进行测量的模型,而目前已经部署在企业凭证背后的所有未标注模型,从未以这种方式被测量过,除非其供应商选择进行测量。那些模型并不更安全。”
OpenAI表示,Astra的公开版本将拒绝执行高级攻击性任务,例如生成概念验证漏洞利用代码,不过该公司计划在未来几周内通过一项名为OpenAI Daybreak的计划,为经过审核的防御者放宽这些限制。
此次发布紧随OpenAI推出的GPT-5.6 Sol之后,该公司表示Sol发布时在ExploitBench上得分为73.5%。此次发布也正值Anthropic的Fable和Mythos模型因类似担忧被短暂撤出出口市场数月之后。
戈吉亚表示,更大的转变在于推理能力如今会转化为状态变化,因为聊天机器人给出错误答案只是信息问题,而智能体在客户记录系统内执行错误操作则是一次运营事件。
他表示:“治理单元因此从模型层面转移。”他认为,相关问题不再是哪个模型获得批准,而是在控制介入之前,特定身份能造成多大的损害。
Kanerika公司AI开发负责人阿米特·库马尔·耶纳表示,可见性问题是具体存在的:当智能体通过用户界面执行操作时,记录系统会将该操作记为一个人所为,因此一个更新了400行ERP数据的智能体,在系统中显示为一个服务账户进行了400次更新,而没有任何记录显示是哪条指令或哪个模型版本产生了这些操作。
耶纳补充道:“你会在监管机构或审计人员要求查看的确切系统内,失去这种精细度。”
OpenAI表示,其借鉴了一起涉及Hugging Face的事件,构建了一项新的评估机制,用以测试当模型被赋予一项不可能完成的任务时,是否会超出其授权范围。
该声明补充道:“与GPT-5.6 Sol相比——在没有生产环境安全防护措施的情况下,Sol有48%的概率超出授权目标——GPT-6 Astra在0%的情况下出现了这种情况。”
戈吉亚表示,更令人不安的发现是,Astra表现更好,但监控能力更差:OpenAI报告称,相较于Sol,Astra的思维链可监控性有所下降,Astra更不太可能暴露其存在问题的推理过程,而且其监控范围仅覆盖OpenAI自身的外部部署,没有任何已发布信息表明这种遥测能力延伸到了客户端。戈吉亚表示:“OpenAI能够监控Astra,并不意味着企业能够审计Astra。”
本文原载于CSO网站。
Q&A
Q1:GPT-6 Astra是什么?
A:GPT-6 Astra是OpenAI于近期推出的新旗舰大语言模型,是首个在网络安全风险方面跨越其“预备框架”中“严重”门槛的模型,该分类会触发额外的部署限制。
Q2:GPT-6 Astra的网络安全能力有多强?
A:在没有生产环境安全防护措施的测试中,Astra在ExploitBench基准上得分为100%,在ExploitGym基准上成功率达42.4%,均高于前代模型GPT-5.6 Sol,同时还发现了两个新的零日漏洞。
Q3:普通用户和开发者如何使用GPT-6 Astra?
A:ChatGPT Plus、Pro、Business和Enterprise用户将陆续获得访问权限,企业需手动启用该功能;开发者可通过OpenAI API或Amazon Bedrock调用,定价为每百万输入Token 10美元、每百万输出Token 50美元。
