OpenAI周四发布了其最新旗舰模型GPT-6 Astra。该公司将其描述为"全球最智能、最对齐的模型",从基准测试数据来看,这一说法似乎名副其实。

在发布前的媒体会上,OpenAI总裁格雷格·布罗克曼的表态比基准测试数据更进一步。他先是承认AGI仍是个"模糊不清的概念",随后暗示未来的观察者可能会将Astra视为AGI真正到来的标志性节点。

布罗克曼表示:"我认为,认为我们现在已进入AGI时代并不是不合理的想法。"

当被问及OpenAI是否在正式宣布已实现AGI时,他表示这个术语已不再与合同触发条件绑定(此前该公司与微软有相关协议),而更应被理解为一种"使命概念或精神概念"。

布罗克曼补充道:"我确实把这个判断权留给读者,让大家自己判断这是否符合他们心中的标准。就我个人而言,我确实认为我们已经到了那个阶段。我认为这是有相当充分理由支撑的观点。但同样,我认为这只是一段旅程的开始,而非终点。"

他在发布会最后说道:"欢迎来到AGI时代。"

OpenAI迄今为止最大规模的训练

据OpenAI的艾丹·克拉克介绍,Astra是OpenAI迄今为止规模最大的训练项目。他表示:"这是我们首次在得克萨斯州星际之门(Stargate)站点使用超过10万块GPU进行预训练。"克拉克还指出,Astra是OpenAI首个在训练过程中大量借助早期模型进行监督的发布模型。

不过,普通用户目前还无法立即使用Astra。该模型的推出将先从已通过OpenAI Daybreak计划获得访问权限的企业客户开始。

OpenAI表示,Astra将在"未来几天内"向Plus、Pro、Business和Enterprise用户推出,同时也将通过OpenAI API和AWS提供服务。

Pro、Business和Enterprise用户还将获得GPT-6 Astra Pro的访问权限,符合条件的API客户将能够使用具备零数据保留功能的Astra。

定价方面

一旦在API中上线,Astra的定价为每百万输入Token 10美元,每百万输出Token 50美元。这是Sol当前促销价格的2.5倍,不过与Anthropic对Fable 5.1的定价相当。

这一价格远高于Muse每百万输入Token 1.25美元、每百万输出Token 4.25美元的标准价格。Meta还提供一个每百万输入/输出Token分别为0.10美元/0.20美元的贡献者版本,但表示该层级的数据可用于改进其产品。谷歌Gemini 3.8 Flash的入门价格为每百万输入/输出Token 0.75美元/3.75美元。

如果模型能以更少的步骤完成任务、减少重试次数,那么更高的单Token价格未必意味着更高的总账单。OpenAI表示,Astra在多项评估和合作伙伴测试中使用的Token数量更少。但目前发布的数据还过于有限,无法证明这些节省是否足以抵消价格溢价。

布罗克曼表示:"真正重要的是每个任务的成本。"

与GPT-5.6不同,OpenAI尚未宣布GPT-6会推出Luna、Terra和Sol等变体版本。目前该系列仅包括Astra和Astra Pro两款。

Astra的优势与不足

OpenAI表示,除非特别说明,其评估中所有模型均以最大算力运行。这可以提升基准测试成绩,但也会增加延迟并消耗更多Token。

Astra在DeepSWE v1.1测试中的表现相较OpenAI此前的模型有明显提升。在包含113项任务的智能体编程测试中,其得分为74.1%,而Sol为70.8%。

但本周早些时候,Meta报告称其Muse Spark 1.3在最大推理设置下取得了75.4%的成绩。Muse 1.3已上线,但最高设置目前仍处于安全审查阶段,发布时不会全面开放。

这对Meta而言是一次意外的胜利。在这种规模的基准测试中,1.3个百分点的差距大致相当于一到两项任务的差异,但仍能看出Meta取得的进步。

目前公开的DeepSWE排行榜显示,Gemini 3.8 Flash和Claude Opus 5的得分均为74%,Sol为73%。这些结果的误差范围存在重叠,因此并不能确定明确的领先者。OpenAI的图表中未纳入Muse的数据,且使用了Fable 5.1的67.4%这一结果,这使得Astra的优势显得比整体数据所呈现的更为明显。

Astra在编程之外的领域取得了更大的提升。

其中最突出的是在ARC-AGI-3测试中取得的98.6%的成绩。OpenAI使用了一套Responses API框架来运行Astra,该框架能在多轮对话间保留推理过程,并通过压缩技术管理长上下文。该公司此前已证明,这类系统设计选择可以在不改变底层模型的情况下大幅提升ARC-AGI-3得分,因此该基准测试实际上是在同时评估Astra与OpenAI的智能体系统。

Astra在FrontierMath Tier 4测试中取得的97.6%成绩,似乎覆盖了该层级43道题目中41道未公开的私有题目。负责运行该基准测试的Epoch AI表示,OpenAI为其开发提供了资金支持,并对其中部分题目拥有独家访问权限,这一点值得注意。

在BenchCAD包含1000个文件的Vision2Code子集测试(使用Python工具)中,Astra得分95.9%,而Fable 5.1和Sol分别为84.3%和83.3%。BenchCAD要求模型根据渲染视图重建CAD程序,并根据生成的3D模型的几何重叠度进行评分。OpenAI指出,Claude的测试结果使用了经过修改的评估设置,但相较Sol的差距依然显著。

在要求智能体完成70项跨五个科学领域命令行研究任务的Terminal-Bench Science测试中,OpenAI报告Astra得分为64.6%。Anthropic报告Fable 5.1得分为52.6%,而现有公开排行榜上Opus 5的最高得分仅为30%。

Anthropic在发布Fable 5.1时也将大量篇幅用于介绍其科学应用,包括由Mythos 5.1(即同一底层模型但安全限制更少的版本)设计的蛋白质结合物的早期湿实验结果。两家公司都在努力让各自的模型从单纯回答科学问题迈向真正参与科研工作流程。

Codex会有哪些变化?

对开发者而言,Astra处理超出上下文窗口任务的方式,可能比基准测试的提升更为重要。

目前Codex依赖于压缩技术,即对早期工作内容进行摘要以释放上下文空间。但这一过程可能会丢弃后续任务中恰好需要的细节:比如此前的某次修复为何失败、运行了哪些测试,或者用户在任务开始时提出的某个小要求。

而Astra能够跨上下文窗口保留笔记,并检索此前的消息和工具输出内容。目前该功能仍处于实验阶段,需要通过config.toml设置开启。OpenAI表示,未来几周内该功能将成为Astra的默认设置。

Astra还可以在不阻碍与答案无关工作的前提下向用户提问。这样可以避免因单一悬而未决的决策而拖慢整个任务进度,这也是编程智能体常见的失败模式之一。

OpenAI展示了Astra操作KiCad、Excel、Blender和Power BI等应用程序,以及执行基于浏览器的表单填写和网站质量检测等任务的能力。

在测试跨桌面应用程序工作能力的OSWorld V2-Offline基准测试中,OpenAI表示Astra得分为72.6%,高于GPT-5.6 Sol的65.7%。同时,该模型将每项任务的平均耗时从约75分钟缩短至40分钟。

Anthropic曾报告Fable 5.1取得了更高的77.9%的成绩,但表示该测试使用了不同版本的OSWorld,因此不应与此前公布的成绩直接比较。

OpenAI同时对Codex框架进行了调整。在Mind2Web测试中,搭载新框架的Astra完成任务的速度比当前基于Sol的方案快1.9倍。

能力更强,但监控难度更大

OpenAI关于Astra是其"最对齐模型"的说法,部分依据来自一项内部测试:在面对不可能完成的任务场景时,Astra有0%的概率会超出授权目标行事,而Sol的这一比例为48.2%。

OpenAI将旧模型的测试环境描述为"没有生产级安全防护措施运行",但并未清晰说明周边安全体系所起的作用,这使得两者之间难以进行直接对比。

该公司还透露,在专门设计用于诱发"规避监控"行为的评估中,Astra的书面推理过程比Sol更难以监控。OpenAI将这一情况部分归因于Astra在处理简单任务时对其书面推理拥有更强的控制力,且完成问题所需的书面推理步骤更少。

OpenAI首席科学家雅库布·帕霍茨基表示:"智能方面的进步并不能保证对齐方面的进步。"他补充道,OpenAI"将在重新获得对未来模型足够的监控信心之前,暂缓进一步扩大规模。"

网络安全能力提升,访问权限更趋收紧

OpenAI表示,Astra已跨越其《预备框架》中网络安全领域的"关键"(Critical)门槛。在公司测试中,该模型能够针对经过安全加固的浏览器和操作系统开发出漏洞利用程序。在针对近期V8漏洞进行评估时,该模型还发现了两个此前未知的漏洞。该公司表示正将这些漏洞报告给相关维护方。OpenAI说明,其公布的网络安全测试结果反映的是Daybreak Blue权限下的表现,而非Astra默认的生产环境配置。

OpenAI将ExploitBench和ExploitGym描述为用于测试模型能否将已知软件漏洞转化为可实际运行的漏洞利用程序的测试项目。在ExploitGym测试中,Astra得分为42.4%,高于Sol的30.3%,但OpenAI在测试中取消了两个模型通常适用的六小时时间限制。

在ExploitBench测试中,两个模型均取得了100%的成绩。

OpenAI指出,通过标准渠道访问的Astra版本将拒绝执行部分高级网络安全相关工作,包括漏洞发现类任务。

OpenAI正在通过Daybreak计划向首批经过审核的防御性研究人员提供限制较少的访问权限,并表示将在未来几周内通过Daybreak Blue扩大Astra的访问范围。需要说明的是,Daybreak Blue是专为授权防御性工作设立的访问权限计划,并非独立的Astra模型或推理模式。

对于通过API使用该模型的开发者,网络安全安全检查机制将直接终止相关任务,而不会暂停等待人工批准。

OpenAI的米娅·格拉泽还提醒,未加入其可信访问权限计划的用户在执行网络安全相关工作时,可能会遇到速度变慢、任务暂停或被拒绝执行的情况——有时即便是执行与网络安全无关的工作也会受到影响。当然,这类问题在近期多次模型发布中都曾出现,但仍会给用户带来不便。

她表示:"在发布初期,用户应该对这种情况有所预期。"

Q&A

Q1:GPT-6 Astra是什么?

A:GPT-6 Astra是OpenAI发布的最新旗舰模型,被公司描述为"全球最智能、最对齐的模型",在多项基准测试中表现出色,尤其是在ARC-AGI-3、BenchCAD和科学研究任务方面取得了显著提升。

Q2:GPT-6 Astra的定价是多少?

A:Astra在API中的定价为每百万输入Token 10美元,每百万输出Token 50美元,这一价格是Sol促销价格的2.5倍,与Anthropic对Fable 5.1的定价相当。

Q3:GPT-6 Astra在网络安全方面有什么特殊限制?

A:Astra已跨越OpenAI《预备框架》中网络安全领域的"关键"门槛,能够开发针对加固系统的漏洞利用程序。因此标准访问版本将拒绝执行部分高级网络安全工作,OpenAI正通过Daybreak Blue计划向经审核的防御性研究人员逐步开放更多访问权限。

The New Stack