7月初,OpenAI面向全球应用和API用户正式开放了GPT-5.6系列模型。自发布以来,用户可在三个版本之间自由选择:Sol定位最强性能,Terra面向主流使用场景,Luna则是日常任务的高效轻量选项。

Sol的名字来源于拉丁语中的"太阳",OpenAI最初将其定位为更具成本效益的旗舰模型,强调能"从每个Token中获取更多有效产出",并配备了公司迄今发布的最完善安全机制。OpenAI宣布为高风险操作和敏感网络请求提供更强防护,并花费数周时间进行压力测试,主动排查系统漏洞。

然而,尽管安全层面做了大量强化,开发者们最感兴趣的,依然是GPT-5.6 Sol的核心功能与解决问题的能力。

基于德克萨斯州达拉斯-沃斯堡的内容自动化平台公司BlogBuster的AI研究与开发负责人Russell Twilligear向The New Stack表示,他在持续使用GPT-5.6 Sol,并将其与Anthropic的Claude Opus 5进行直接性能对比。

"Sol在帮我创建内容和发现Anthropic模型错误方面表现更好,简直让我叹为观止,"Twilligear说。

他进一步介绍道:"我正在构建一个涵盖逾300万条目的美国全国性大型数据库,Sol不断发现并纠正Opus犯下的错误。于是我反过来测试:让Sol构建数据库,再让Claude Opus 5检查,结果它几乎没发现什么问题,只有一些无关紧要的小瑕疵……所以目前要判断这个市场上各模型的真正边界,确实还是一件颇具挑战性的事情。"

值得注意的是,Twilligear的对比测试并非标准的同类模型横向评估——用一个模型生成内容、另一个模型审查,并不能简单地将前者定性为"更好",但它确实揭示了两者在生成与审核工作流中的不同表现方式。这或许不是模型评估的决定性依据,但提供了真实的开发者使用体验,其参考价值不可忽视。

AI战略与技能公司Concepts in Success创始人、AI治理和模型评估独立研究员Joshua Estrin博士向The New Stack表示,这类数据库对比场景对于理解开发者体验颇具参考价值,但"仅凭这一点还不够",无法在未与"真实基准数据"对照的情况下断言哪个模型更准确。

"用一个模型生成内容、另一个模型审查,衡量的是一个比整体模型质量更窄的维度,"Estrin说,"如果某个模型未能指出另一个模型数据库中的错误,这可能更多反映的是提示词或任务设定的差异,而非原始模型本身的错误率。在评出胜者之前,我希望两份输出都能与真实数据进行对照,而不仅仅是相互比较。"

哥伦比亚大学商学院博士候选人、纽约的Shouqiao Wang在X平台发文称,他"用五天时间解决了六个尚未解决的Erdos问题",全程使用OpenAI GPT-5.6 Sol。Erdos问题,即由匈牙利数学家保罗·埃尔德什提出的一系列未解数学猜想,长期是离散数学和近似理论领域的重要挑战。

"我有数学背景,但我使用的Codex工作流并不需要深厚的数学知识,"Wang写道,"关键在于模型选择。我使用了GPT-5.6 Sol,并设置为最高推理强度。与早期模型相比,它能在更广泛的问题类型上有效运作,在维持长时间、严格的数学探索方面也明显更胜一筹。"

此处有必要说明:OpenAI将"ultra(超强)"定义为其最高能力设置,通过协调多个智能体在并行工作流中运作,以更快速度完成复杂任务——即多个子智能体可同时处理一个大型问题的不同部分。在低、中、高、超高、最高等档位之上,"ultra"更进一步,以更高的Token消耗换取更强的结果质量和更快的任务完成速度。综合来看,Sol拥有一套六速推理档位系统。

"我将提示词粘贴到Codex中,设定目标,然后让它自主运行,"Wang详细介绍道,"Codex可以长时间持续工作,完整保留研究上下文,并在无需进一步干预的情况下调用本地文件。你需要保持耐心,给它足够的时间去探索。"

苏格兰爱丁堡旅游预订系统自动化软件公司Viamki的创始人Jean Bustinza向The New Stack表示,GPT-5.6 Sol如今已成为他的"首选模型",理由充分。

"有时,在让它输出代码之前,我会先和它进行深度对话,探讨过去这类模型很难涉及的高层级话题,比如整体架构方向,"Bustinza说。

他将这种体验比作"与一位资深软件开发者交流"(尽管偶尔它也会说出让人摸不着头脑的话),并表示GPT-5.6 Sol给出的信息和推理逻辑通常极具价值。

"不过,我发现Sol 5.6最主要的问题是它有时会把事情过度设计一番。对于一些前端任务,我偶尔还是会转向Claude或Gemini来解决规模较小的问题,"Bustinza补充道。

如果非要在模型性能竞赛中找出赢家,总体共识还是指向那个经典答案——"视情况而定",取决于开发者具体要将模型能力应用于何种场景。

我们需要记住:一个人眼中的"前沿模型长周期多日自主任务分析",未必等同于另一个人的"多轮任务完成与复杂科学研究工作负载"——更何况还要考虑每Token成本和性价比的差异。

开发者的声音,值得我们持续倾听。

Q&A

Q1:GPT-5.6 Sol和Claude Opus 5相比,谁更强?

A:目前没有定论。有开发者测试发现Sol在生成内容和发现错误方面表现更优,但研究者指出,这种"一个模型生成、另一个审查"的方式并非标准评测,结果更多反映的是任务分工差异,而非整体能力高下。真正的比较需要将两者输出都与真实基准数据对照才有说服力。

Q2:GPT-5.6 Sol的"ultra"推理模式是什么?

A:OpenAI将"ultra"定位为最高能力设置,通过协调多个智能体并行处理复杂任务的不同部分,以更高的Token消耗换取更强的结果和更快的完成速度。有研究者利用该模式配合Codex工具流,在五天内解决了六个Erdos数学难题。

Q3:GPT-5.6 Sol有什么明显缺点?

A:开发者反映,Sol有时会对问题进行"过度设计",在处理一些规模较小的前端任务时显得复杂度偏高。部分开发者在这类场景下仍会选择切换到Claude或Gemini来解决具体的小问题。

The New Stack