OpenAI Group PBC今日开始向部分用户开放GPT-6 Astra,这是该公司最新、能力最强的大语言模型。
该公司表示,这款大语言模型在多个领域展现出“业界领先”的性能,涵盖编程、浏览网页以及计算机操作能力,后者指的是模型需要与应用程序图形界面进行交互完成任务的能力。此外,Astra在三项全球最具挑战性的人工智能基准测试中均取得满分成绩。
Astra通过的第一项测试名为FrontierMath Tier 4,其中包含50道数学难题,即便是人类数学家通常也需要数周时间才能解出。OpenAI表示,Astra在该测试中的完成率达到98%。
该模型在基准测试中取得的优异成绩并不算意外。在正式发布之前,Astra就已经解决了数个埃尔德什问题——这些是研究人员格外关注的数十年未解的数学难题。此外,它还在计算复杂性理论这一计算机科学分支领域取得了若干进展。
在衡量大语言模型学习新任务能力的ARC-AGI-3基准测试中,Astra取得了99.9%的高分。这项能力被认为是实现通用人工智能(AGI)的重要前提。该模型在衡量大语言模型发现并利用软件漏洞能力的ExploitBench测试中,同样拿到了满分。
周二,OpenAI披露,根据其内部AI安全评估框架,Astra被列为“关键”风险等级。当一款大语言模型展现出无需人工干预即可入侵“众多防护严密的系统”的能力时,就会被列入该级别。正因为Astra具备的网络安全相关能力,OpenAI不得不将其发布时间推迟数周。该公司表示,工程师们利用这段时间开发了针对黑客攻击的防护机制。
OpenAI表示,Astra处理复杂任务的能力部分源自一种全新的数据管理方式。
大语言模型在生成提示响应的过程中会产生大量数据。当这些数据无法容纳在模型的上下文窗口中时,一种被称为“压缩”的机制就会对其进行压缩处理,低优先级的信息会被舍弃,以便为新的请求腾出空间。
Astra同样会压缩提示内容以腾出空间处理新数据,但它不会丢弃原始信息,而是将其以可检索的形式归档保存,必要时可以随时调取。这种方式保留了模型可用于提升输出质量的数据点。
发布之初,Astra仅通过一个名为Daybreak的项目向少数客户开放,该项目使相关机构能够使用OpenAI的模型开展网络安全研究。未来几天,该公司将逐步扩大Astra的可用范围,使其接入ChatGPT、Codex以及应用程序编程接口。
OpenAI今日表示,将为Daybreak项目的参与者提供总计10亿美元的额度,目的是帮助政府机构、公用事业单位及其他关键服务运营方提升网络安全防护水平。这笔额度不仅涵盖模型使用费用,还包括培训和客户支持费用。OpenAI还将与非营利组织MS-ISAC合作提供部分培训,该组织致力于帮助公共部门机构抵御网络攻击。
Q&A
Q1:GPT-6 Astra是什么?
A:GPT-6 Astra是OpenAI推出的新一代大语言模型,在编程、浏览网页、计算机操作等多个领域表现出业界领先水平,并在多项高难度AI基准测试中取得满分或接近满分的成绩。
Q2:GPT-6 Astra为什么被列为“关键”风险等级?
A:因为该模型展现出无需人工干预即可入侵众多防护严密系统的能力,根据OpenAI内部安全评估框架,这一能力使其被列为“关键”风险等级,也导致其发布被推迟数周以完善安全防护机制。
Q3:普通用户现在能使用GPT-6 Astra吗?
A:目前该模型仅通过Daybreak项目向少数用于网络安全研究的客户开放,OpenAI计划在未来几天内将其逐步接入ChatGPT、Codex及应用程序编程接口,扩大使用范围。
