SpaceXAI近日发布旗舰大语言模型Grok 4.6,声称在部分能力上可超越Anthropic的Claude Fable 5。

SpaceXAI前身为xAI,上个月完成更名,这一品牌变化源于其被SpaceX收购。今年6月,合并后的公司以史上最大规模IPO的方式在纳斯达克挂牌上市。

距上一款旗舰大语言模型发布仅一个月,SpaceXAI便推出了Grok 4.6。据官方介绍,此次升级的核心改进之一是工程师对模型进行了更长时间的训练。此次扩展训练采用了AI生成的数据集,旨在提升Grok 4.6的推理能力。SpaceXAI还为该模型引入了"高质量工程数据"。

初始训练完成后,模型还经历了两个额外的开发阶段:第一阶段采用有监督微调(SFT)方法,第二阶段使用强化学习。

有监督微调通过一套样本提示与预设答案来优化大语言模型的输出,工程师主要借助该技术确保模型响应以用户友好的格式呈现。SpaceXAI使用Grok 4.6的前一代产品Grok 4.5来优化Grok 4.6的SFT训练阶段,重点提升其在科学与编程任务上的能力。

在评测方面,SpaceXAI使用了Artificial Analysis Intelligence Index基准,该数据集整合了科学、编程、金融服务等领域的九项主流AI评测。Grok 4.6获得61分,与OpenAI旗舰产品GPT-5.6 Sol持平,比Claude Fable 5低一分。

此外,SpaceXAI还在另外九项基准上进行了横向对比。Grok 4.6在其中三项评测中超越了Claude Fable 5,包括AA-Briefcase——一项用于评估大语言模型完成人类需要数周才能完成的知识型工作的基准测试——以及另外两项涵盖逾半数行业的综合评测。

SpaceXAI表示,Grok 4.6尤其擅长根据高层级描述生成软件原型,在生成界面等视觉资产方面也优于前代产品,同时在长周期项目中更倾向于主动检查错误。

定价方面,Grok 4.6标准版为每百万输入Token 2美元、每百万输出Token 6美元;SpaceXAI还提供速度更快的版本,价格为标准版的两倍。该大语言模型可通过Cursor(SpaceXAI于今年6月以600亿美元收购的编程平台)以及自研编程工具Grok Build访问使用。

Q&A

Q1:Grok 4.6在主流AI基准测试中的表现如何?

A:Grok 4.6在Artificial Analysis Intelligence Index评测中获得61分,与OpenAI的GPT-5.6 Sol持平,比Anthropic的Claude Fable 5低一分。在另外九项基准测试中,Grok 4.6有三项超越了Claude Fable 5,包括用于评估复杂知识型工作能力的AA-Briefcase,以及另外两项跨行业综合评测。

Q2:Grok 4.6的训练方式和前代产品有什么不同?

A:相比前代产品,Grok 4.6进行了更长时间的训练,并使用了AI生成的数据集以增强推理能力,同时引入了高质量工程数据。训练分为三个阶段:初始训练、有监督微调和强化学习。其中,有监督微调阶段由Grok 4.5协助优化,重点提升了科学与编程任务上的输出质量。

Q3:Grok 4.6的价格是多少,在哪里可以使用?

A:Grok 4.6标准版定价为每百万输入Token 2美元、每百万输出Token 6美元;快速版价格为标准版的两倍。用户可通过SpaceXAI以600亿美元收购的编程平台Cursor,或自研工具Grok Build访问该模型。

SiliconANGLE