阿里巴巴本周发布了Qwen3.8-Flash,这是一款开放权重的多模态混合专家(MoE)模型。

紧随本月初发布的Qwen3.8 Max之后,这款拥有1250亿参数的AI模型被定位为Qwen4的前奏之作。该模型兼具性能与性价比双重定位,据称在编程和办公任务方面具有"卓越能力",并在能力、延迟和成本之间实现了最优平衡。

阿里巴巴在发布博客中确认:"在此次发布中,我们开放了Qwen3.8-Flash-Next的权重,这是一款多模态MoE模型,同时也是Qwen4所采用架构的早期预览。"

阿里巴巴为何以及如何提供早期预览模型

通过提前发布Qwen3.8-Flash中的架构变化,该公司希望社区能够检视其中的技术机制、结构与组件,并在完整的Qwen4模型系列构建之前就开始实际测试这些内容。

通过声明Qwen3.8-Flash为Qwen4铺路,阿里巴巴展示(并且重要的是,公开分享)了它将延续到后续模型中的设计形式,以便开发者能够提前开始构建(或至少规划)他们的下一代代码库。

具体而言,阿里巴巴表示Qwen3.8-Flash"扮演了与Qwen3-Next对Qwen3.5相同的角色",也就是说,该公司的意思是,Qwen3.8-Flash向开发者引入了公司的混合Gated DeltaNet + Gated Attention设计(这是一种计算组件,使AI模型能够在推理和训练过程中平衡长上下文效率与上下文聚焦及注意力),该设计随后被应用于Qwen3.5、Qwen3.6、Qwen3.7和Qwen3.8系列。

阿里巴巴表示:"Qwen3.8-Flash-Next从注意力机制、残差连接、嵌入和优化这四个方面对模型进行了系统性升级,在提升模型能力的同时,进一步优化了计算效率、模型容量和训练稳定性。"

对比竞品模型的基准测试成绩

在智能体编程、长周期智能体任务和多模态智能方面进行基准测试时,Qwen3.8-Flash相较于DeepSeek-V4-Flash和Claude-Opus-4.6等模型表现不俗,测试涵盖SWE-bench Pro(智能体编程)、CoWorkBench(长周期办公任务)、Toolathlon Verified(真实工具使用)、MathVision(视觉数学问题求解)、AndroidWorld(智能体移动端使用)和ERQA(具身智能)。

"Qwen3.8-Flash-Next从注意力机制、残差连接、嵌入和优化这四个方面对模型进行了系统性升级,在提升模型能力的同时,进一步优化了计算效率、模型容量和训练稳定性。"

在使用SWE-bench Pro测试智能体编程能力时,Qwen3.8-Flash-Next得分62.5,而Qwen3.8-27B得分61.7,Qwen3.7-Plus得分55,DeepSeek-V4-Flash-0731得分56.0,Claude-Opus-4.6(Max)得分53.4。

值得注意的是,阿里巴巴详细说明,Qwen3.8-Flash仅需"约九分之一的训练资源",却能实现更优异的性能表现。该公司表示,这意味着与体量三倍于它的Qwen3.7-Plus相比,Qwen3.8-Flash"显著降低"了训练和推理成本。

Qwen3.8-Flash-Next与Qwen3.8-Flash有何区别

从命名角度来说,Qwen3.8-Flash-Next是面向开发者开放权重的前沿研究模型,可在Hugging Face AI开发者中心和阿里巴巴的魔搭社区平台上获取。基于相同的底层架构,Qwen3.8-Flash是该模型的生产版本,通过QwenCloud API提供,默认支持100万Token,并内置官方工具。

Qwen3.8-Flash-Next拥有1250亿参数的主模型,并辅以额外的510亿N-gram嵌入,每个Token激活60亿参数。该模型原生支持262,144个Token的上下文,并可通过YaRN技术扩展至100万Token。

架构方面进行了哪些更新

如前所述,Qwen3.8-Flash在注意力机制、残差连接、嵌入和优化方面进行了架构扩展。其混合注意力架构结合了压缩历史信息的Gated DeltaNet(GDN)与Qwen Sparse Attention(QSA,一种新颖设计,采用轻量级压缩索引器来选择相关上下文),大幅降低了长序列的注意力计算成本。

阿里巴巴解释称,Gated Residual(GR)机制拓展了层间数据通路,同时增强了跨层信息流动和训练稳定性。N-gram嵌入技术以极小的额外计算量扩展模型容量,而Muon优化器则提升了大规模模型训练的效率。

"如果本地大语言模型如今真能取代远程模型,那我会非常开心,而且我也没理由在自己的体验上撒谎……但对于本地专业软件开发而言,它(目前)还做不到。"

开发者如何评价Qwen3.8-Flash

从开发者反馈来看,目前评价褒贬不一。

机电工程师Alok在X平台发文称,他认为显存(VRAM)壁垒——即在模型量化旨在实现更好长上下文推理的背景下,对物理高速GPU显存进行大语言模型内存管理的需求——现已正式终结。

Alok兴奋地写道:"我刚刚在一块24GB的RTX 4090上运行了拥有25万上下文窗口的Qwen3.8-Flash-Next(MoE)125B A6B模型——解码速度达到每秒21个Token,预填充速度为每秒364个Token——没有使用mtp,没有dflash,也没有KV缓存量化!我们正在消费级硬件上运行数据中心级模型。"

而多领域软件开发者Embedding Shapes则不那么满意。

他在Hacker News上用一些颇为生动的言辞描述了模型在处理非常基础的任务时如何频频出错,随后表示:"如果本地大语言模型如今真能取代远程模型,那我会非常开心,而且我也没理由在自己的体验上撒谎。我也曾因网上关于Qwen 3.8的正面评价而抱有希望,但对于本地专业软件开发而言,它(目前)还做不到。"

定价与访问方式

Qwen3.8-Flash可通过API Model Studio和阿里巴巴的AI原生云平台Qwen Cloud访问。每百万Token的定价为:输入0.16美元,输出0.47美元(中国境内开发者为3元人民币)。

该模型同时也在阿里巴巴的职场AI智能体平台QwenWork上提供,运行经过重新设计的"标准模式",与当前模式相比,每项任务的Token消耗降低75%,生成速度"大约提升一倍"。

阿里巴巴表示,这使得旗舰级能力得以应用于日常工作负载,开发者可以在他们很可能已经拥有的硬件上运行该模型。

阿里巴巴Qwen4计划何时发布

阿里巴巴尚未确认Qwen4的确切发布日期。不过,随意在网上搜索这一话题就能发现,众多评论人士和市场观察人士普遍认为该模型将在今年年底前发布,最早可能在9月份就会推出。

围绕这一话题的猜测包括:下一代模型系列是否会针对复杂的3D编程和设计任务进行优化,专攻高级空间建模;也有人认为混合专家(MoE)架构将得到扩展,并可能具备更深层次的原生多模态处理能力。

本文已就此事联系阿里巴巴征求更广泛的评论,但对方拒绝回应。

Qwen,繁体中文写作"通義千問"(拼音:Tōngyì qiān wèn),英文意为"关于普遍意义的千个问题"。这周末的本地酒吧问答活动上可以用上这个知识点。

Q&A

Q1:Qwen3.8-Flash是什么?

A:Qwen3.8-Flash是阿里巴巴发布的开放权重多模态混合专家(MoE)模型,拥有1250亿参数,被视为Qwen4架构的早期预览版本,在编程和办公任务方面具备较强能力。

Q2:Qwen3.8-Flash相比之前的模型有什么优势?

A:Qwen3.8-Flash仅需约九分之一的训练资源,却能实现比体量三倍于它的Qwen3.7-Plus更优的性能,显著降低了训练和推理成本,同时在多项基准测试中表现优于DeepSeek-V4-Flash等竞品模型。

Q3:普通用户或开发者如何使用Qwen3.8-Flash?

A:开发者可通过Hugging Face和阿里巴巴魔搭社区获取开放权重版本Qwen3.8-Flash-Next,也可通过QwenCloud API或阿里职场AI平台QwenWork使用生产版本,每百万Token输入价格为0.16美元,输出为0.47美元。

The New Stack