人工智能
Together AI的AI工程师扎因·哈桑(Zain Hasan)已经养成了一套使用AI编程助手的习惯,同时也会留意成本问题。遇到复杂任务时,他会调用当前最先进的前沿模型,例如Anthropic的Fable;而面对相对简单的任务,他则会选择能力稍弱、价格更低的大语言模型。
目前,哈桑倾向于选择GLM 5.2作为低价替代方案。这款模型由北京AI实验室Z.ai于6月16日发布,属于开放权重模型,即任何拥有足够硬件资源的机构都可以免费下载并自行部署。
选择通过Z.ai的API付费使用GLM 5.2的用户同样可以节省开支——该公司的API定价为每百万输出Token 4.40美元,不足Anthropic Opus 4.8模型同等服务价格的五分之一,也仅为Anthropic Fable编程模型价格的十分之一。所谓输出Token,是模型针对提示词生成回复时的基本文本单位。
然而,哈桑指出,全球许多软件工程师对某个编程项目的AI总成本并没有充分的认知。
"很多公司目前仍在摸索这项技术,因此并没有真正设定Token预算,"哈桑说。当费用由公司承担时,许多软件工程师的理性选择就是完全跳过成本核算这一步——"最省事的做法就是直接选最强大的模型。"
这种不考虑价格的使用习惯,加上软件公司普遍宽松的Token预算管理,或许正是目前保护美国前沿AI实验室竞争地位最宽阔的护城河。
GLM 5.2是一款大语言模型,拥有7530亿个参数,但每次推理时仅激活其中400亿个参数——这种优化方式显著提升了模型的响应速度。Z.ai以MIT开源许可证发布该模型,意味着任何人都可以自由分发、复制、修改和使用。
GLM 5.2的发布加剧了外界对美国AI公司可能丧失竞争优势的担忧。在FrontierSWE和PostTrainBench等智能体编程基准测试中,该模型的得分几乎与Opus 4.8持平。网络安全研究人员也发现,GLM 5.2在网络安全基准测试中表现出色,这一能力引发了外界将其与Anthropic的Mythos进行比较的讨论。
Z.ai的崛起折射出一个更宏观的趋势。根据斯坦福大学AI指数(一份每年超过300页的AI趋势年度调查报告),2025年中国企业发布的"值得关注"的AI模型数量已超过美国同行的一半,相比2023年的约三分之一和2020年的约五分之一,这一比例持续提升。
GLM 5.2在基准测试中的亮眼表现令部分美国观察人士忧虑不已——该模型在开放权重模型以及中国研发模型中均创下新纪录。与此同时,该模型的中国背景也给一些担心通过中国相关基础设施传输敏感数据的美国及其他国家企业带来了合规顾虑。
不过,开放权重的特性提供了一条可行的出路:任何担心数据流向的机构都可以选择在自有硬件上自行部署模型,而无需依赖外部服务。这与大多数前沿模型形成鲜明对比——后者通常只能通过API访问,不提供自行部署的选项。
Z.ai在发布GLM 5.2的同时,配套发布了一份研究报告以支撑相关数据。值得注意的是,该报告并未提及Anthropic的Mythos和Fable——这两款模型在报告发布时虽已对外宣布,但尚未公开发布。报告的比较对象主要是Anthropic的Opus 4.8和OpenAI的GPT-5.5。尽管GLM 5.2在多项基准测试中的表现接近Opus 4.8,但报告仅声称在两项难度较低的推理基准测试中取得领先,在编程类测试中则未能胜出。
报告中大量基准测试的结果显示,GLM 5.2在智能体编程方面落后于Opus 4.8(有时也落后于OpenAI的GPT-5.5)。例如,在难度较高的长时智能体编程基准测试SWE-Marathon中,GLM 5.2仅完成了13%的任务,而Claude Opus 4.8的得分是其两倍。Opus 4.8还在NL2Repo、DeepSWE和Tool-Decathlon等编程基准测试中保持了10%以上的领先优势。
将GLM 5.2与自身工作流程进行实测的软件工程师,反馈结果则参差不齐。
"我用GLM 5.2后发现,它更擅长处理跨度较长的任务,"哈桑说——他所在的公司将GLM 5.2部署在北美的基础设施上。他表示,早期的开放权重模型在经过五到十五轮对话后往往就会"断线",而GLM 5.2的表现明显不同:"我发现用这个模型能连续工作好几个小时,它依然能保持连贯的思路。"
丹佛MetaRouter公司的首席软件工程师大卫·尼克斯(David Nix)在日常工作和个人项目中都会用到大语言模型(他同时也运营着一个面向AI工程师的求职平台)。尼克斯表示,GLM 5.2与Anthropic Opus、OpenAI GPT-5.5等前沿模型"非常接近",足以让他将其纳入常用模型阵容。
"比如在前端开发方面,它表现相当不错,很多时候我不需要去动用Opus或Fable,"尼克斯说。他估计,在日常发送给大语言模型的任务中,有10%到20%由GLM 5.2处理,在某些特定场景(如前端设计)中,它甚至是他的首选。
哈桑和波兰克拉科夫Screen Studio的软件工程师卡斯帕·米卡利克(Kacper Michalik)也有类似的反馈。哈桑认为GLM 5.2在网页设计方面"审美感很强";米卡利克则表示,他用GLM 5.2为网站生成表单时取得了不错的效果。
不过,也有工程师反映体验不够理想。班加罗尔Indhic AI公司的软件工程师赛·基兰·米亚达拉姆(Sai Kiran Myadaram)在GLM 5.2发布后第一周就订阅了Z.ai的套餐,但他发现模型消耗Token的速度极快,"Z.ai提供的每周配额,我不到两三天就用完了。"米卡利克虽然也遇到了偶发的速率限制问题,但他使用的是免费套餐,对模型质量本身并无明显不满。
除速率限制外,米亚达拉姆还遇到了模型幻觉和过度规划的问题,尤其是在处理简单的前端修复任务时,"它把我的代码库搞乱了。"此后,他已逐渐回归OpenAI的Codex。
Q&A
Q1:GLM 5.2和Anthropic Opus 4.8在编程能力上差距大吗?
A:在部分智能体编程基准测试(如FrontierSWE、PostTrainBench)中,GLM 5.2的得分接近Opus 4.8,但在难度更高的SWE-Marathon测试中,GLM 5.2仅完成13%的任务,Opus 4.8则完成了约26%。此外,Opus 4.8在NL2Repo、DeepSWE、Tool-Decathlon等编程测试中也保持10%以上的领先。总体来看,GLM 5.2与顶级前沿模型之间仍存在一定差距,但在前端开发等特定场景下表现接近。
Q2:GLM 5.2的价格比其他模型便宜多少?
A:GLM 5.2通过Z.ai的API调用定价为每百万输出Token 4.40美元,不足Anthropic Opus 4.8同类服务价格的五分之一,仅为Anthropic Fable编程模型价格的十分之一。此外,GLM 5.2也是开放权重模型,有足够硬件的机构可以免费下载并自行部署,进一步降低使用成本。
Q3:GLM 5.2的开放权重对数据安全有什么意义?
A:GLM 5.2以MIT开源许可证发布,允许任何机构将模型部署在自有硬件上,无需将数据发送至Z.ai或任何第三方服务器。这一特性对担心数据安全或对中国相关基础设施存有顾虑的企业尤为重要,因为自行部署意味着数据完全留在本地,规避了数据流向的潜在风险。
