中国前沿模型公司Z.ai于上周五发布了GLM-5.3,该模型基于与前代GLM-5.2相同的代码库构建,所有性能提升均来自训练后优化阶段。官方声称最新版本在复杂编程和长周期任务方面有显著改进。

训练后优化流程涵盖推理对齐、监督微调以及基于人类反馈的强化学习(RLHF)等多个环节。Z.ai在一篇匿名博客中表示:"过去一个月,我们在GLM-5.2的技术栈基础上持续扩展:更多环境、更多样化的任务,以及投入更多算力进行训练。"

该公司进一步说明,扩展后的模型训练环境覆盖了"更广泛的生产工作流",任务类别的设计贴近工程与研究工作的实际执行方式。部分任务的复杂程度相当于一名有经验的工程师数天的工作量。

Z.ai举例说明:"在一项机器学习基础设施任务中,模型所处的工作环境与工程师相同,可访问计算集群、存储系统、内部文档、代码库及实验结果。它必须诊断训练栈中的瓶颈、实施优化、运行实验,并在保证正确性的前提下实现可衡量的端到端提速。"

在基准测试方面,Z.ai推出了内部评估体系Z.ai Code Bench,测量结果显示GLM-5.3的编程能力较GLM-5.2提升了50%。公司认为,私有基准测试"降低了公开测试集数据污染的风险",能更真实地反映用户实际使用体验。此外,公司还公开展示了在TerminalBench 3.0、DeepSWE、Agents' Last Exam、AutomationBench、HLE w/ Tools(人类最终考试)以及OpenAI的GDPVal-AA v2等多项公开基准上的表现。

开发者如何看待GLM-5.3

在基准测试之外,真实的开发者对开源权重模型领域的现状有何看法?

长周期自主软件工程公司NonBioS.ai联合创始人尼尚特·索尼向媒体表示,对于Z.ai在长周期任务上的扩展训练声明,他基于自身实际经验持审慎态度。

"据我所知,没有任何基准测试能客观证明GLM-5.3在真实任务中所声称的长周期能力优势,"索尼说,"Z.ai所描述的特定编排方式,不太可能提供足以在前沿模型中培养这种能力的差异化、全面性数据集。"

他进一步补充:"我怀疑这在很大程度上是为了转移外界对该模型真实能力来源的注意力——其模式与对Anthropic模型进行工业级蒸馏的特征高度吻合。"

索尼表示,NonBioS内部测试发现,Kimi/GLM的输出与Claude的输出之间存在"惊人的相似性"。相比之下,其他前沿模型(尤其是Gemini和Grok)与Claude输出的差异性则更为明显。

AI基准测试专业公司Megaton创始人谢里夫·希加兹表示,他认为任何前沿模型公司(或用户、团队)建立一套以Token消耗与任务完成情况为衡量维度的内部评估体系都是合理的。

"当一个模型针对基准测试进行训练,而不仅仅是追求表面能力,这通常是件好事,"希加兹说,"但要让智能体持续提供有价值的输出,需要双向配合——团队必须围绕智能体的工作方式调整其工作环境,例如强制执行重复测试,或将输入输出变得机器可读且可验证,才能获得最佳结果。"

他补充道:"Z.ai声称开发者可以将这部分负担转移到模型训练环节,从而获得更好的任务表现。如果能将智能体训练成能在更多样化、更真实的环境中工作,它就能在更少监督的情况下完成更长、更复杂的任务。也许并非所有人都认同这种方式,但它值得纳入考量。"

AI工具数据准确性公司Sphinx联合创始人兼CEO罗汉·科迪亚拉姆表示,正是因为模型迭代速度极快,他不会将企业基础设施绑定在当前领先的某个模型上。

"OpenAI、Anthropic、谷歌以及越来越多的中国开源权重模型正在不断互相超越,"科迪亚拉姆说,"我们认为业务上下文应该独立于底层模型,这样企业在切换模型时无需重新教导新系统如何理解自身业务。模型无关性正在从一种技术偏好演变为对抗AI市场不确定性的对冲策略——因为没有人知道六个月后哪个模型会最优秀。"

他指出,一旦多个模型的能力达到大致相当的水平,模型选择就更多地取决于具体工作负载,而非排行榜名次。成本、延迟、隐私、部署方式、工具使用能力,以及在特定任务上的实际表现,往往比基准测试分数的细微差异更重要。

"企业应避免让自己的模型选择变得不可逆,要随着能力、经济性和基础设施的演变构建可迁移的架构。此外,还存在超越单个企业的全局性模型选择问题:算力的可及性决定了哪些模型能真正大规模运行,而目前为OpenAI和Anthropic等提供商服务的基础设施,远多于Z.ai的GLM等新兴选择。"

基准测试刷分还是真实能力

在Hacker News上讨论GLM-5.3的帖子相对有限,其中机器学习研究员内森·兰伯特的评论最具洞见。他在自己的Interconnects博客上发文,探讨了中国实验室究竟如何与硅谷前沿玩家保持竞争的问题。

兰伯特首先质疑东方前沿玩家是否存在"基准刷分"行为——即将模型指向测试集以取得好看的基准分数,但这些分数在实际部署中无法复现。尽管Z.ai声称其最新模型基于复杂的真实开发者工作流构建,兰伯特认为即便存在刷分行为,程度也相当微妙。

"OpenAI和Anthropic极有可能拥有远优于Z.ai和月之暗面的内部模型。但这些美国公司往往需要数月时间才将模型发布给公众,这在市场采用决策上极大地为中国实验室提供了优势。简单来说——美国实验室用于发布前测试的时间,中国实验室都用来在基准测试上持续爬分了,"兰伯特写道。

关于GLM本身,其名称源自构建当前模型所基于的通用语言模型(General Language Model)训练算法。该算法依赖自回归空白填充技术——这是一种通过完形填空测试删除或遮盖模型数据片段的训练方式,旨在提升模型的词汇量、理解力与推理能力。

GLM-5.3完全开源,Z.ai确认将在发布两周后(约2026年8月底)、完成安全评估与加固后,公开GLM-5.2的模型权重。

Q&A

Q1:GLM-5.3相比GLM-5.2有哪些具体改进?

A:GLM-5.3基于与GLM-5.2相同的代码库,所有性能提升均来自训练后优化阶段,包括推理对齐、监督微调和基于人类反馈的强化学习。Z.ai内部基准Z.ai Code Bench显示,GLM-5.3的编程能力较GLM-5.2提升了50%。训练环境也扩展到更广泛的生产工作流,部分任务复杂度相当于有经验工程师数天的工作量。

Q2:有开发者认为GLM-5.3是蒸馏Anthropic模型得来的,依据是什么?

A:NonBioS.ai联合创始人尼尚特·索尼在内部测试中发现,GLM/Kimi的输出与Claude的输出之间存在"惊人的相似性",而Gemini、Grok等其他前沿模型与Claude输出的差异性则更大。他认为Z.ai关于长周期任务训练的描述,不足以解释其前沿能力的来源,因此怀疑该模型对Anthropic模型进行了工业级蒸馏。

Q3:企业在选择AI模型时应该注意什么?

A:Sphinx公司CEO罗汉·科迪亚拉姆建议,由于前沿模型迭代极快,企业应避免将基础设施强绑定于某一特定模型。业务上下文应独立于底层模型,以便在不同模型间灵活切换。当多个模型能力相近时,成本、延迟、隐私、部署方式和特定任务表现往往比基准分数更重要,构建可迁移的架构是应对AI市场不确定性的关键策略。

The New Stack