在AI领域,Meta本周动作频频。公司先是正式推出编程智能体Muse Code,脱离测试阶段并同步上线三档全新订阅方案。随后在周三深夜,Meta又发布了低成本推理模型Muse Spark 1.3,公司称这是该模型系列迄今在编程与智能体任务上取得的最大进步。

Muse Spark 1.3可通过Muse Code和Meta模型API使用,这是Meta自今年4月首次推出该推理模型以来的最新迭代版本,距离上一版本Muse Spark 1.2发布还不到一个月。Meta首席执行官马克·扎克伯格在社交媒体上大力宣传这一新版本,称其带来了“几乎便宜到可以忽略计费的前沿性能”。

“这是我们在编程和智能体工作上迄今取得的最大跃进。”扎克伯格在X平台上写道。

开放权重版本“即将推出”

扎克伯格还确认,Muse Spark的开放权重版本将“即将推出”,这一举措可能让开发者能够下载模型并在自有基础设施上运行,从而绕开Meta托管的API。

不过,具体的开放程度目前尚不明确,因为Meta还未公布该版本将附带的许可条款。此前Meta发布的开放权重模型都附有不同程度的使用限制,因此这些细节将决定Spark未来能被多自由地修改、再分发或部署。

值得注意的是,扎克伯格还用了一个颇为贴切的西瓜表情符号,预告了Meta备受期待的下一代模型,代号为“Watermelon”。

据了解,该模型的规模将远超Spark,据商业内幕网7月的报道,当时该模型仍处于训练阶段。目前尚无关于Watermelon具体发布时间的确切消息,但从扎克伯格的暗示来看,发布应该不会太久。

不过就目前而言,Meta已经为Spark 1.3本身给出了相当大的宣传力度。扎克伯格在帖子中附上了一张基准测试表,将该模型与OpenAI的GPT-5.6 Sol及Anthropic的Claude Opus 5在编程、智能体、计算机操作和长上下文测试中进行对比。

在这些亮眼数据中,Muse Spark 1.3在DeepSWE编程基准测试中得分75.4%,在512K-1M版本的MRCR长上下文测试中得分98.1%。

不过这些是Meta自行整理的结果。公司表示,Spark 1.3的分数是通过Meta模型API生成的,而对比数据则来自Meta自身的评测、官方排行榜以及竞争对手模型提供商公布的结果。Meta还将其对第三方模型的测试描述为“尽力而为”,这意味着该表格不应被视为在完全相同条件下进行的单一独立对比测试。

这些结果还有另一个注意事项:Meta在进行头条对比时,将Spark 1.3运行在全新的“max”推理等级上,而目前开发者普遍可用的最高推理等级是“xhigh”。“max”等级仍处于有限预览阶段,Meta正在为此完成额外的安全测试。

“手套已经摘下”:Spark 1.3的实际表现如何

来自Artificial Analysis的独立测试提供了一个有用的外部视角。这家总部位于旧金山、专注于AI模型和提供商基准测试的公司,给公开可用的Muse Spark 1.3 xhigh在其智能指数上打出了61分的成绩,比Spark 1.2高出4分,与GPT-5.6 Sol max、Grok 4.6 high和Claude Opus 5 high持平。该机构还测试了处于有限预览阶段的max版本,得分为62,在其发布时的对比模型中仅落后于Claude Fable 5.1和Claude Opus 5。

云基础设施公司CoreWeave的AI布道者亚历克斯·沃尔科夫指出,这张图表证明了Meta在缩小与领先模型差距方面的速度之快。

“天呐,这真是不留情面!”沃尔科夫在X平台上写道,称这是Meta发出的“相当有力的声明”,并预测“接下来会是忙碌的几周!”

成本是Meta宣传的另一个重点。Artificial Analysis将Spark 1.3 xhigh描述为在其所测智能水平下“成本效益最高的模型”,其61分的智能指数得分与相对较低的单任务成本相结合,使其位于该公司的帕累托曲线上。

Artificial Analysis计算得出,Spark 1.3 xhigh每个智能指数任务的成本约为0.55美元,是所有在其指数上得分59分及以上模型中最低的。同样获得61分的GPT-5.6 Sol max和Grok 4.6 high,成本分别为0.95美元和0.94美元。

不过,Spark 1.3每任务的成本仍高于Spark 1.2的0.40美元,Artificial Analysis将这一增长主要归因于新模型在智能体评测中消耗了约多57%的输入Token。

Muse对阵Gemini:一场“操场级别的口水战”

值得注意的是,就在Meta发布Muse Spark 1.3前不久,谷歌也推出了自家的全新低成本模型:Gemini 3.8 Flash,这是谷歌在短短六周内发布的第三款Flash系列模型。谷歌同样宣称这是其迄今最出色的推理和编程Flash模型,并将入门定价维持在每百万输入Token 0.75美元、每百万输出Token 3.75美元。

Artificial Analysis最初将Gemini 3.8 Flash(high版本)列入其智能与成本帕累托前沿——即那些没有任何替代模型能在能力更强的同时价格更低的模型群体。Gemini在智能指数上得分59,每任务成本为0.58美元。

然而仅仅几个小时后,Muse Spark 1.3 xhigh便以61分和每任务0.55美元的成绩到来,在两项指标上都超越了Gemini 3.8 Flash,将其挤出了这一前沿位置。

这一点没有逃过许多AI社区人士的注意。AI研究员本杰明·马里在X平台上指出,“谷歌领先的时间只有短短几个小时。”

AI基础设施与研究公司Prime Intellect的研究工程师弗洛里安·布兰德也简洁地总结了这一转折。

“Gemini 3.8在帕累托前沿的位置保持了……让我查一下……3.5小时。”布兰德在X平台上写道。

甚至Meta首席AI官亚历山大·王本人也发声,借着Artificial Analysis报告的势头对谷歌进行了一番讽刺。

不过,云与AI成本管理公司Duckbill联合创始人兼首席云经济学家科里·奎因很快就调侃了这场交锋,认为无论是Meta还是谷歌,都并未真正引领AI竞赛的节奏。

“Meta在AI领域对谷歌的讽刺,就像是在MMA冠军赛外面上演的操场口水战。”奎因在X平台上写道。

Muse Code登场

作为背景信息,Muse Spark 1.3是Meta自4月以来发布的第四个版本,此前分别是7月发布的Muse Spark 1.1和随后一个月发布的1.2。不过,可以说Meta此番推进中更重要的部分,是其正在围绕该模型打造的智能体框架。

这一框架体现为Muse Code,Meta基于终端的编程智能体,该产品于8月初随Spark 1.2以测试版形式亮相。周二,它正式全面上线,配套推出了起价仅为每月5美元的全新订阅方案,同时一款全新SDK也进入了开发者预览阶段。

因此,尽管Meta显然正试图在模型质量上与前沿实验室竞争——Muse Spark系列的进步便是证明——但公司同样在更高的层面上追赶对手,而在这一层面,Anthropic的Claude Code和OpenAI的Codex已经为开发者日常使用智能体的方式设定了节奏。

这也解释了为何1.3版本发布语言中如此多地聚焦于编程和智能体工作本身。该模型是Meta正在大力推进的更广泛开发者平台中的关键一环,而Meta目前在价格上的发力,几乎不亚于在能力上的投入。

Q&A

Q1:Muse Spark 1.3是什么?

A:Muse Spark 1.3是Meta最新推出的低成本推理模型,专注于编程和智能体任务,可通过Muse Code和Meta模型API使用。

Q2:Muse Spark 1.3和谷歌Gemini 3.8 Flash相比表现如何?

A:根据Artificial Analysis的测试,Muse Spark 1.3 xhigh在智能指数上得分61,每任务成本0.55美元,两项指标均优于Gemini 3.8 Flash,将其挤出了成本效益前沿位置。

Q3:Meta是否会推出Muse Spark的开放权重版本?

A:扎克伯格确认开放权重版本“即将推出”,届时开发者将可以下载模型并在自有基础设施上运行,但具体许可条款尚未公布。

The New Stack