xAI近日推出Grok 4.5模型,面向希望控制AI辅助软件开发成本的开发者和企业。

据该公司介绍,Grok 4.5的定价为每百万输入Token 2美元、每百万输出Token 6美元。该模型专为编程和智能体任务设计,运行速度达每秒80个Token,且在部分软件工程任务中相较同类模型消耗更少的Token。

Grok 4.5可通过xAI控制台和Grok Build访问,同时也已接入由Anysphere开发的AI编程工具Cursor,借此让xAI得以进入开发者日常使用的开发环境,而不仅仅依靠API参与竞争。xAI表示,欧盟地区预计将于7月中旬正式开放访问。

今年6月,SpaceX(xAI母公司)宣布收购Cursor背后的初创公司Anysphere,旨在巩固其在企业AI工具领域的地位。Cursor方面也表示,Grok 4.5是与xAI联合训练的,训练过程中使用了数万亿Token的Cursor数据,包括用户与代码库及软件工具的交互记录。

此次发布切中了企业工程团队日益普遍的一个痛点:一旦AI编程智能体超越简单提示词的应用场景,成本便会迅速攀升。

Counterpoint Research研究副总裁Neil Shah表示:"企业正在AI投资回报率上碰壁。自主智能体和编程任务所消耗的大量Token正带来账单冲击,使得AI采用变成了一条昂贵的单行道。"

根据Artificial Analysis的编程智能体指数,Grok 4.5在Grok Build中的表现低于Claude Code中的Fable 5,与Codex中的GPT-5.5大致持平。据测算,Grok 4.5每项任务的成本约为2.49美元,相比之下,Codex中的GPT-5.5为5.07美元,Claude Code中的Fable 5为11.80美元。

这组数据为xAI提供了有力的佐证,但分析师指出,企业在大规模采用之前,仍需针对自身代码库对模型进行实际测试。

市场研究公司JP Data的董事总经理Anand Joshi表示:"现在判断Grok 4.5是否具有颠覆性还为时过早。基准测试数据令人印象深刻,低Token消耗对企业颇具吸引力。开发者社区最终会给出评判,看其编程输出是否真正优于竞争对手。"

Forrester首席分析师Biswajeet Mahapatra指出:"Grok 4.5的定价值得关注,因为它降低了运行智能体编程工作负载的经济成本,但企业买家应关注的是每次成功交付的成本,而非每个Token的成本。"

他还补充说,一款更便宜的模型如果需要反复尝试才能生成可用代码,实际花费反而可能更高。企业应综合评估编程工作流程的全链路成本,包括开发者的审查投入以及最终输出的可用性。

Omdia首席分析师Lian Jye Su则提出了一个更深层的隐忧:Token消耗量已被过度用作衡量价值的指标。

"我们正处于一个将Token消耗视为终极价值创造的时代,但真正的价值仍在于任务是否真正完成。对大多数企业而言,单任务完成成本才是评估智能体效能的最佳标准。"

这意味着,Grok 4.5绝非一个简单的定价故事,而是对xAI能否在真实工程环境中切实降低AI辅助开发成本的一次检验——在企业实际代码库中,公开基准测试往往难以暴露模型的真实短板。

Mahapatra建议,SWE-Bench Pro、DeepSWE和Terminal Bench等测试可提供早期信号,但企业在更广泛部署前,仍应在自有代码库上将Grok 4.5与其他模型进行横向比较。Su则建议在真实开发环境中开展A/B测试,并结合持续的成本监控,以获得Token效率和输出质量的更清晰认知。

单凭价格优势,Grok 4.5不太可能撼动更成熟的企业AI平台。其近期更现实的定位,在于软件工程工作流程,尤其适合那些已在同时使用多个模型、并尝试按成本、速度和准确性进行任务分配的企业。

Su认为,Cursor和Grok Build的用户最有可能从这款模型中获益。Mahapatra则表示,Grok 4.5有望成为部分团队的主力编程助手,特别是以软件工程为核心业务的团队,但大型企业更可能将其纳入多模型混合策略中加以测试。

Neil Shah指出,随着企业对单一AI供应商的依赖愈发审慎,这一转变已在悄然发生。他表示,高风险或复杂任务可能仍会交给Claude等模型处理,而Grok 4.5若能证明其准确性与竞品相当,则有望吸引高频开发工作流和重复性智能体任务的场景。

Shah还补充称,Cursor或许能为xAI带来额外优势。通过使用Cursor的开发者交互数据进行训练,Grok 4.5有望受益于一个基于程序员实际编写、审查和调试代码行为的反馈闭环。

Q&A

Q1:Grok 4.5的定价是多少,和竞品相比贵不贵?

A:Grok 4.5的定价为每百万输入Token 2美元、每百万输出Token 6美元。根据Artificial Analysis的测算,其每项任务成本约为2.49美元,而Codex中的GPT-5.5约为5.07美元,Claude Code中的Fable 5约为11.80美元,整体价格在同类模型中具有明显优势。

Q2:企业在评估Grok 4.5时,应该只看Token价格吗?

A:不应该只看Token价格。多位分析师指出,更关键的指标是"每次成功任务的成本"。如果模型需要反复尝试才能生成可用代码,实际成本反而会更高。企业应综合考量编程工作流的全链路成本,包括开发者的审查时间和最终输出的可用性,并建议在自有代码库上进行实际测试后再做决策。

Q3:Grok 4.5和Cursor是什么关系?

A:Cursor是由Anysphere开发的AI编程工具,已被SpaceX收购。Grok 4.5是xAI与Anysphere联合训练的,训练数据包含数万亿Token的Cursor用户交互记录。这意味着Grok 4.5能直接在Cursor中使用,让xAI进入开发者的日常工作环境,同时也使模型能从真实的编程行为数据中持续受益。

Computerworld