马特·伯恩斯,Insight Media Group首席内容官。他每周整理最重要的AI动态,解析这些进展对于将AI投入实际应用的个人与组织意味着什么。

Grok 4.6于周三发布,Qwen 3.8-Max在几小时后跟进,随后DeepSeek V4-Pro于周四上线。三款前沿模型在大约24小时内接连亮相,三者均主打性价比——因为能力层面已是默认前提。

很难反驳埃隆·马斯克在X上的表态:"综合智能、速度与成本来看,Grok 4.6客观上排名第一。"两年前,前沿模型的发布主打能力;如今主打价格。每一项基准测试,都成了为更低账单背书的依据。

本周三款前沿模型中有两款提供了可下载权重,这正是为什么闭源实验室所能索取的价格上限,正越来越多地被那些免费开放模型的公司所决定。

这也解释了为何马斯克收购Cursor的交易,在今天看来比六月时更顺理成章。当模型在价格上趋于一致,钱就会流向那个决定"哪个模型来干活"的人。马斯克买下的正是这个位置。

Grok 4.6登顶,靠后训练而非更大模型

SpaceXAI用两句话宣布了Grok 4.6:前沿智能水准,以及"在相同价格下较Grok 4.5有显著提升"。Artificial Analysis给出了61分的智能指数,比4.5高出5分,与GPT-5.6 Sol持平。在GDPVal-AA排行榜上,它以1753分的Elo积分登顶,略高于Fable 5 Max的1741分。

这5分从何而来?并非来自更大的模型。正如产品分析师阿卡什·古普塔所指出的,Grok 4.6运行于与4.5相同的1.5万亿参数之上,所有提升均来自后训练阶段。Terminal-Bench单版本跳升66%。API定价始终未变:每百万Token输入2美元、输出6美元,因为相同的权重意味着相同的服务成本。这次提升,从本质上说是免费的。

本周剩余的动态,则进一步诠释了这一价格逻辑。

阿曼达·卡斯韦尔梳理了SpaceXAI在那两句话中刻意略去的基准数据:CursorBench v3.2得分69.9%,略低于Fable 5 Max的70.5%,在DeepSWE榜单上也落后于同类竞品。

当阿里巴巴宣布Qwen 3.8-Max时,顾问杰夫·布罗考的质疑被引用:他将"承诺开放权重却尚未发布"的做法称为"API商业模式穿上开源外衣在发布会上拍照"。这一评价在当时不无道理。目前权重已经公开。DeepSeek随后在一天之内发布了V4-Pro,新增对OpenAI Response API的原生支持,并推出区分高峰与非高峰时段的定价方案,非高峰价格为高峰的一半——前沿智能,现在也有了夜间和周末套餐。

面对这一局面,投资人加文·贝克做了一道买家真正会算的账:Grok 4.6的输入Token比Fable 5 Max便宜80%,输出便宜88%。他的结论只有两个字:"帕累托占优。"

如果开发者的备选方案是Hugging Face上的一个文件,实验室就无法单凭提升能力来涨价,只能以旧价推出更好的模型,自己消化差价。

更便宜的模型不会压缩预算,而会催生更多需求

Box CEO亚伦·莱维解释了接下来会发生什么,值得直接阅读原文。简而言之:更便宜的模型不会缩减AI预算,而是会为那些企业本就想做却负担不起的工作买单——比如让智能体扫描整个代码库寻找安全漏洞,或通读每一份合同。他将其称为杰文斯悖论,笔者认为他说得对:越便宜,买得越多。莱维随之指出,当更多模型针对不同任务和成本进行调优,"能够根据任务进行路由和优化的那一层,价值就越大。"

低价模型不会均匀地商品化整个技术栈,价值会向那个决定"哪个模型做什么"的人倾斜。

英伟达本周正是推出了这类产品。Frederic Lardinois报道了Nemotron 3.5 Lightning,一个开源的300亿参数模型,以及NeMo Switchyard——一个将不同任务分配给最合适模型的开源路由器。英伟达自己的数据显示,Switchyard将开源模型与Anthropic的Opus 4.8搭配使用,成本降至约三分之一,同时保持前沿精度。

模型越具有可替换性,路由器的价值就越大。路由器将模型选择从架构决策变成了运行时决策。离开某家供应商不再意味着重写系统,而是修改一下配置文件——容易被替换的供应商,也就很难随意涨价。

Sara Nóbrega在Towards Data Science上发布了这一趋势的实践版本,包括她观察到的企业实际采用比例:约70%使用本地小模型,20%使用中端API,10%使用前沿模型。她援引英伟达研究估计,40%至70%的企业AI任务已在100亿参数以下的模型上运行。

最显而易见的反驳是:每Token更便宜,不等于每项任务更便宜。这一点公平。杰西卡·瓦克特尔为我们对比了DeepSeek的V4-Flash与V4-Pro,发现预算版模型在最难的任务上推理表现更好,但为此消耗了三倍的Token数。最终账单:9美分对10美分。标价能告诉你的信息极为有限,直到你把自己真实的工作跑过一遍。

马斯克买下的不只是Cursor,而是一整套AI闭环

这就把话题引回了Cursor。SpaceX今年6月宣布将以全股票方式收购该公司,估值600亿美元。值得注意的是,这笔交易尚未完成交割。当时外界的解读是,这是一种昂贵的方式来招募一支编程工具团队。本周,人们开始看清他买下的究竟是什么。25岁的Cursor联合创始人兼CEO迈克尔·特鲁尔协助发布了Grok 4.6,并公开背书称4.6"将Opus级别的智能与精细打磨,和极低成本及高速度结合在一起"——Cursor的CEO,已不再是在公开场合介绍马斯克最新模型,更像一个局内人。

Grok Bot在此前一天上线,被定位为AI团队成员,"登录你的工具、像你一样使用它们,然后带着完成的工作回来。"工程师陈坤花了一天时间将其拆解,发现底层正是Cursor。每位用户获得一个云端虚拟机,Mac和iOS应用是轻量客户端,真正的编程工作则被转交给Cursor的云端智能体。他写道,Grok Bot"显然是基于Cursor构建并重新品牌化的。"

于是,SpaceXAI如今拥有了算力、模型、智能体框架,以及数亿潜在用户。

算力是其他人无法凭空建起的部分。马斯克早已预判算力和电力将成为瓶颈,彭博社报道称,仅Anthropic一家每月就向SpaceXAI支付12.5亿美元的算力费用。今年春天,SpaceXAI自有模型仅使用了其可用算力的11%,而Anthropic正深陷算力短缺。

马斯克不必赢得模型竞赛,只需保持跟跑。同样,开放权重实验室不必登顶前沿,只需为整个前沿设定价格。

给你一条知易行难的建议:选一个开放权重模型,用真实工作跑一遍。不是因为Codex或Claude会消失,而是因为那张定价表上的每一个折扣,都源于可下载模型给了买家另一个选项——试试那些选项吧。

Q&A

Q1:Grok 4.6相比上一版本有哪些提升?

A:Grok 4.6在Artificial Analysis智能指数上得分61分,比Grok 4.5高出5分,与GPT-5.6 Sol持平,并在GDPVal-AA排行榜上以1753分Elo积分登顶。值得注意的是,这些提升并非来自更大的模型——Grok 4.6仍运行于与4.5相同的1.5万亿参数之上,所有进步均来自后训练阶段优化,Terminal-Bench单版本提升高达66%。API定价维持不变,每百万Token输入2美元、输出6美元。

Q2:为什么前沿AI模型现在越来越强调价格而不是能力?

A:核心原因在于开放权重模型的兴起。当开发者可以直接从Hugging Face下载模型权重作为备选方案时,闭源实验室就无法单凭提升能力来涨价。本周发布的三款前沿模型中有两款提供可下载权重,这使得模型能力趋于收敛,竞争重心自然转向价格。Grok 4.6的输入Token比Fable 5 Max便宜80%、输出便宜88%,被投资人称为"帕累托占优"。

Q3:马斯克收购Cursor对SpaceXAI的AI布局有什么战略意义?

A:收购Cursor让SpaceXAI形成了完整的AI闭环:自有算力(其他公司如Anthropic每月支付12.5亿美元购买其算力)、前沿模型Grok 4.6、基于Cursor构建的智能体框架Grok Bot,以及X平台上的数亿用户。当模型能力与价格趋于一致时,真正的竞争优势在于决定"哪个模型干哪项工作"的路由层,而Cursor正是掌控这一层的关键资产。

The New Stack