SpaceX公司今日发布了迄今为止能力最强的大语言模型Grok 4.7。

Grok算法系列最初由埃隆·马斯克创立的初创公司xAI Corp.开发。马斯克去年将该公司与xAI Inc.进行合并。合并后的组织随后并入SpaceX,SpaceX因此不仅获得了Grok模型系列,还获得了多个人工智能数据中心。

该公司使用名为CursorBench 4.0的基准测试对Grok 4.7进行了评估,该基准由SpaceX近期收购的另一家公司Cursor开发。Grok 4.7完成基准测试中挑战任务的平均成本为每项任务4.69美元,领先于GPT-5.6 Sol和Fable 5.1。SpaceX评估的是后两款模型中优先考虑输出质量而非成本效益的硬件密集型版本。

该公司还使用更广泛采用的基准测试对Grok 4.7进行了测试。该模型在分别包含法律和芯片设计任务的Harvey Legal Agent Benchmark和EEBench测试中,轻松超越了Fable 5.1。不过,Grok 4.7在后一项基准测试中的得分落后于OpenAI Group PBC的最新大语言模型GPT-6 Astra。

SpaceX将Grok 4.7的性能提升归功于全新的基础模型。大语言模型的训练过程包含多个阶段,每个阶段都会改进算法开发中的不同方面。基础模型是训练过程第一阶段结束后产生的大语言模型初始版本。AI提供商通常会在不同的大语言模型发布版本中复用基础模型。

据SpaceX介绍,其工程师还优化了Grok 4.7的强化学习工作流程。强化学习是一种用于增强基础模型推理能力的AI训练方法。与前代产品相比,Grok 4.7接受了更具挑战性的训练任务,且训练时间更长。

该公司在构建这款大语言模型时,使其能够与Grok Bot框架兼容。这是一套技术资源集合,使Grok 4.7能够将复杂工作拆分给多个AI智能体处理。这些智能体可以并行执行多项不同任务,从而加快处理速度,并相互验证输出结果的准确性。

SpaceX还为Grok 4.7配备了新的安全防护机制。该公司表示,该模型在LatchBio和HackerBench基准测试中创下了新纪录,这两项测试分别用于检验大语言模型阻止恶意生物学研究请求和网络安全攻击请求的能力。

Grok 4.7的定价为每百万输入Token 2美元起,每百万输出Token 6美元起。针对对延迟敏感的工作负载,SpaceX还推出了处理速度提升一倍、价格也相应提高一倍的模型版本。

此次发布距离SpaceX上一次发布模型不到一周时间。上周五,该公司推出了一款文本转语音模型,其准确率是前代产品的两倍,而成本仅为前代产品的一半。SpaceX表示,Grok Voice Transcribe 2.0在文本转语音领域的表现也超越了多个竞争对手的产品。

Q&A

Q1:Grok 4.7有哪些主要提升?

A:Grok 4.7采用了全新的基础模型,并优化了强化学习工作流程,接受了更具挑战性、更长时间的训练。在多项基准测试中表现优异,尤其在成本效益方面领先于GPT-5.6 Sol和Fable 5.1等竞品模型。

Q2:Grok 4.7的定价是多少?

A:Grok 4.7的定价为每百万输入Token 2美元起,每百万输出Token 6美元起。SpaceX还提供了处理速度更快的版本,价格为标准版的两倍。

Q3:Grok 4.7在安全性方面有哪些改进?

A:SpaceX为Grok 4.7配备了新的安全防护机制,该模型在LatchBio和HackerBench基准测试中创下新纪录,能够有效阻止恶意生物学研究请求和网络安全攻击请求。

SiliconANGLE