阿里巴巴发布了Qwen3.8-Flash-Next的模型权重,作为即将推出的Qwen4架构的预览版,供开发者实验和评估。这是一个多模态混合专家(MoE)模型,总参数量达1760亿,其中包含510亿N-gram嵌入参数,每个Token激活60亿参数。模型原生支持262,144 Token的上下文窗口,并可通过YaRN扩展至100万Token。
NVIDIA通过SGLang、vLLM和NVIDIA TensorRT LLM提供Day 0功能支持,在NVIDIA GB300 NVL72上完成推理验证,并提供来自NVIDIA NeMo AutoModel和NVIDIA NeMo RL的后训练方案。
Qwen3.8-Flash-Next专为高吞吐量、上下文密集型应用场景设计,涵盖智能体编程、文档处理和工具驱动工作流。随着上下文增长,注意力计算和KV缓存内存会成为瓶颈。该模型通过结合门控DeltaNet(GDN)与Qwen稀疏注意力(QSA)的混合架构来解决这两个问题。每四层中有三层使用GDN,将历史上下文持续压缩为固定大小的循环状态,从而消除序列增长时的KV缓存膨胀问题;剩余一层使用QSA,在完整上下文中实现精准检索。
此前的稀疏注意力方案依赖Token级索引器,随着上下文长度增加,计算开销也随之上升。QSA将序列聚合为微块,在块级别估算重要性,仅选取最相关的区域,从而降低每层的注意力计算和索引开销,使其非常适合GDN与QSA交替的架构设计。
阿里巴巴公布的基准测试数据显示,QSA能够显著提升百万Token工作负载的效率。与全量注意力相比,其注意力内核在预填充阶段实现了最高7.6倍的加速,在解码阶段实现了4.9倍的加速。在100万Token上下文长度、90%前缀缓存命中率的在线服务测试中,Qwen3.8-Flash-Next的预填充吞吐量达到Qwen3.7-Plus的8.6倍。
GB300 NVL72采用机架级架构,将72块NVIDIA Blackwell Ultra GPU集成于单一平台。其大规模72-GPU NVLink域支持以130 TB/s的速率进行高效全互联通信,消除了专家流量跨越传统网络时产生的瓶颈。在NVIDIA GB300 NVL72上运行,每GPU每秒可处理超过16,000个Token,每用户每秒超过200个Token,使开发者能够以高吞吐量、低延迟的方式实验智能体编程应用。
除机架级部署外,Qwen3.8-Flash-Next还支持在本地NVIDIA硬件上运行,包括NVIDIA DGX Station、NVIDIA DGX Spark集群,以及配备四块NVIDIA RTX PRO 6000 Blackwell工作站版GPU的工作站。开发者可在本地硬件上完成智能体编程工作流的原型验证,再将同一模型扩展至GB300 NVL72进行生产部署。
开发者可使用NVIDIA NeMo AutoModel对模型进行领域专项微调,这是一个原生PyTorch微调库,支持Day-0 Hugging Face检查点。可直接在现有检查点上训练,无需模型转换,支持全量SFT或内存高效的LoRA微调。用户还可进一步使用NVIDIA NeMo RL方案执行强化学习。
NVIDIA支持多种推理栈以满足不同开发者需求。SGLang、vLLM和TokenSpeed为需要更精细性能控制的开发者提供开源推理方案,均运行于NVIDIA加速平台之上。
模型权重可从Hugging Face或ModelScope下载,也可通过QwenCloud直接体验。
Q&A
Q1:Qwen3.8-Flash-Next是什么类型的模型?有哪些核心参数?
A:Qwen3.8-Flash-Next是阿里巴巴发布的多模态混合专家(MoE)模型,作为Qwen4架构的预览版本。总参数量为1760亿,其中包含510亿N-gram嵌入参数,每个Token激活60亿参数。原生支持262,144 Token上下文窗口,通过YaRN可扩展至100万Token。
Q2:Qwen稀疏注意力(QSA)相比传统全量注意力有多大性能提升?
A:根据阿里巴巴公布的基准数据,QSA在预填充阶段最高可实现7.6倍加速,解码阶段可实现4.9倍加速。在100万Token上下文、90%前缀缓存命中率的在线服务场景下,Qwen3.8-Flash-Next的预填充吞吐量是Qwen3.7-Plus的8.6倍。
Q3:开发者如何对Qwen3.8-Flash-Next进行微调?
A:开发者可使用NVIDIA NeMo AutoModel进行微调,该库基于原生PyTorch,支持Day-0 Hugging Face检查点,无需模型转换即可直接训练。支持全量SFT和内存高效的LoRA两种微调方式,还可通过NVIDIA NeMo RL方案进一步执行强化学习。
