此前在OpenRouter平台上迅速蹿红的神秘模型"Ox-alpha",近日正式揭开面纱——它实际上是Z.ai推出的GLM-5.3-Flash。这是一个拥有3200亿参数的混合架构模型(活跃参数为180亿),由团队专门针对超低成本推理场景训练而成。
本周三,Z.ai正式公开了该模型的身份,并以MIT许可证将其权重发布至Hugging Face平台。目前,该模型已在多个推理平台上线,其中OpenRouter提供的定价为每百万输入Token 0.075美元、每百万输出Token 0.25美元(此为折后五折价格)。
性能表现方面,尽管早期有声音将其与Anthropic的Claude Fable 5相提并论,但从基准测试结果来看,这一说法并不成立。不过,在开启最大推理模式后,GLM-5.3-Flash的表现大体上能够与Claude Opus 4.8以及OpenAI的GPT-5.6 Terra相抗衡。
在Artificial Analysis Intelligence Index评测中,GLM-5.3-Flash获得57分,与GPT-5.6 Terra、谷歌Gemini 3.7 Flash、Meta的Muse Spark 1.2以及Qwen 3.8 2.4T A95B基本持平。
在驱动AI智能体方面,GLM-5.3-Flash的表现甚至优于多个竞品——而这或许更能反映其在真实应用场景中的实际价值。
功能层面,该模型支持多模态输入,涵盖图像、视频和文件。Z.ai特别强调,模型经过专项训练以强化视觉任务能力,包括制作演示文稿和搭建网站;同时在文档处理、电子表格操作和仪表盘管理等知识型工作任务上也有所提升,这些能力均得益于模型增强后的视觉理解能力。
值得注意的是,该模型输出较为冗长,Token消耗量较大。这对于需要更多推理步骤才能达到此类性能水平的轻量级模型而言并不罕见。但由于推理成本极低,这一缺陷的实际影响相当有限。
在定价方面,目前没有任何竞品能够接近Z.ai的价格水平,而这或许正是此次发布最值得关注的核心信号。包括阿里巴巴、DeepSeek和月之暗面(Kimi)在内的中国开源权重模型,其性能正在不断逼近美国前沿实验室的水平,同时以极低的价格对外开放,对于拥有本地硬件的用户更是完全免费。
令早期Ox-alpha用户感到意外的一点是:该实验室能够每天提供多达100万亿次免费Token推理服务(据OpenCode数据),而具备这种基础设施承载能力的服务商极为罕见。更关键的是,Z.ai全程在国产AI芯片上完成了这一壮举——这也是公司在官方公告中重点强调的内容。
Z.ai在声明中写道:"相较于同等硬件条件下的初始基准,我们在端到端服务性能上实现了3倍提升,达到了与主流英伟达GPU相当的硬件效率与单Token成本。这证明国产芯片完全能够在规模化场景下高效、经济地支撑前沿模型推理。"
公司未透露所用芯片的具体型号,但指出这些芯片在算力和内存容量上存在一定局限。为此,Z.ai基于SGLang自研了一套推理引擎,并借助旗舰模型GLM-5.3驱动一个基础设施智能体参与优化——用公司的话说,这形成了"模型协助优化自身所在服务系统"的正向反馈闭环。
训练细节方面,Z.ai未披露训练所用芯片信息,但表示该模型基于30万亿Token的多模态预训练语料构建,采用融合线性注意力与稀疏注意力的混合架构。
团队解释称:"线性注意力通过状态建模捕获局部依赖关系,稀疏注意力则通过轻量级索引器检索相关的全局上下文。"与完整版GLM 5.3模型相比,GLM 5.3-Flash的架构将计算量压缩至原来的三分之一,KV缓存体积也缩减至原来的约五分之一(降低4.4倍)。
该模型支持100万Token的上下文窗口,在此背景下,KV缓存的大幅缩减显得尤为关键。
对于开发者而言,这道选择题并不复杂:一个在智能体相关基准上与Opus 4.8旗鼓相当、价格却仅为其十分之一的模型,很难被忽视。而对于美国的AI实验室来说,更深层的挑战或许才刚刚开始——中国实验室已经证明自己能够以这样的规模提供服务,接下来会发生什么?
Q&A
Q1:GLM-5.3-Flash是什么模型?有什么特别之处?
A:GLM-5.3-Flash是Z.ai发布的一款3200亿参数混合架构大语言模型,活跃参数为180亿,专为超低成本推理设计。它此前以"Ox-alpha"为代号在OpenRouter平台上线,曾迅速成为平台上最受欢迎的模型。该模型支持多模态输入,具备100万Token超长上下文窗口,并已以MIT许可证开源,权重发布于Hugging Face平台。
Q2:GLM-5.3-Flash的推理价格是多少?和竞品相比怎么样?
A:在OpenRouter平台上,GLM-5.3-Flash的定价为每百万输入Token 0.075美元、每百万输出Token 0.25美元(含50%折扣)。与同等性能的竞品相比,该模型价格约为Claude Opus 4.8的十分之一,目前没有竞品能在价格上与其匹敌,低价是此次发布最核心的竞争优势之一。
Q3:GLM-5.3-Flash真的是在国产AI芯片上运行的吗?效果如何?
A:是的。Z.ai明确表示,GLM-5.3-Flash的推理服务全程运行于国产AI芯片之上。Z.ai基于SGLang自研了推理引擎,相较于同硬件条件下的初始基准,端到端服务性能提升了3倍,单Token成本与能效达到了与英伟达主流GPU相当的水平,并实现了每天100万亿Token的免费推理服务规模。
