就在OpenAI Group PBC宣布因安全担忧而暂不发布其最新模型GPT-6.1 Astra的次日,该公司又发布了一款几乎同样强大的新模型——GPT-6.1 Sol,并表示这款模型能以远低于Astra的成本实现相近的性能表现。

这款新模型是在OpenAI今天举行的DevDay开发者大会上发布的。其命名方式让人感到困惑,这也延续了OpenAI自夏季发布GPT-5.6以来愈发复杂的命名惯例。当时该公司一口气推出了三个版本:Sol、Terra和Luna。其中Sol性能最强,Terra居中,Luna则是在成本和速度比精度更重要时使用的轻量化低成本选项。

这样的命名逻辑原本还说得通,但当公司推进到GPT-6系列并将其命名为“Astra”后,情况变得更加混乱。OpenAI表示Astra是该系列中性能最强的版本,随后又发布了Luna和Sol两个版本。Terra不知为何被弃用,而Sol则被降级为中间档位。

如今,GPT-6.1 Sol登场,OpenAI表示它在性能上与GPT-6.0 Astra大体相当,尤其是在编程和智能相关任务方面,区别在于它的价格要便宜得多。

OpenAI展示了一系列基准测试结果来佐证这一说法。例如在用于评估模型软件工程能力的DeepSWE 1.1基准测试中,GPT-6.1 Sol取得了与GPT-6 Astra相同的分数,但每项任务消耗的Token数量仅为后者的约五分之一。在衡量智能体完成多步骤业务流程能力的AutomationBench基准测试中,GPT-6.1 Sol的表现略逊于GPT-6 Astra,但优于Anthropic PBC的Claude Opus 5.5,且Token消耗仅为其约三分之一。

OpenAI还对GPT-6.1 Sol进行了计算机操作任务测试,结果显示其表现比GPT-6 Sol高出超过7%,仅略逊于GPT-6.1 Astra。该公司表示,与GPT-6 Sol相比,GPT-6.1 Sol产生的事实性错误也更少。OpenAI称,使用GPT-6.1 Sol替代GPT-6.0 Astra所带来的成本节省十分可观。据悉,新模型的价格仅为每百万Token 10美分,约为GPT-6.0 Astra价格的一半。正因如此,OpenAI建议将该模型用于编程以及应用程序和文档处理中需要重复执行或长时间运行的工作负载。

尽管如此,Astra仍是OpenAI目前最强大的模型,但问题在于,该公司认为它的能力过于强大,以至于现阶段公开发布并不安全。这也是OpenAI昨天宣布无限期推迟该模型发布的原因,公司援引了自家研究人员以及有机会研究该模型的第三方发出的警告,称其存在未经许可自行采取行动的倾向。OpenAI原计划在今天的DevDay大会上发布GPT-6.1 Astra,但由于推迟发布,新发布的Sol模型反而成为了全场焦点。

OpenAI表示,从今天起,GPT-6.1 Sol将向所有ChatGPT Work以及Codex Plus、Pro、Business、Enterprise和Edu订阅用户开放。该模型目前尚未在标准版ChatGPT应用中上线,但预计不久后将成为可选项。

此外,OpenAI还借DevDay大会发布了一系列名为Dots的“常驻在线”人工智能智能体,它们拥有可爱的表情符号式头像,可作为用户的24小时数字助手,执行更广泛的任务。

Q&A

Q1:GPT-6.1 Sol是什么?

A:GPT-6.1 Sol是OpenAI发布的新模型,性能与GPT-6.0 Astra相近,尤其在编程和智能任务上表现接近,但成本要低得多,每百万Token仅需10美分。

Q2:GPT-6.1 Astra为什么没有按计划发布?

A:OpenAI认为GPT-6.1 Astra能力过强,存在安全隐患,其研究人员和第三方测试者均发现该模型有未经许可自行采取行动的倾向,因此公司决定无限期推迟发布。

Q3:GPT-6.1 Sol现在哪些用户可以使用?

A:从发布当天起,GPT-6.1 Sol已向所有ChatGPT Work以及Codex Plus、Pro、Business、Enterprise和Edu订阅用户开放,标准版ChatGPT应用预计不久后也会上线该模型。

SiliconANGLE