阿里巴巴发布了Qwen3.8-2.4T-A95B(Qwen3.8-Max)的开放权重,这是其规模最大的开源模型,将接近前沿的能力带入了开放生态系统。该模型共有2.4万亿参数,每个Token激活95B参数,采用细粒度混合专家(MoE)架构,融合了全注意力与线性注意力的混合机制,上下文窗口最长支持100万Token,输出长度最高达128K,专为高强度推理和智能体工作负载而设计。

部署一个2.4万亿参数的开源模型,需要数据中心规模的加速计算能力。这一规模的推理依赖于芯片、系统架构和软件的深度协同设计。NVIDIA正与开源社区合作,通过优化内核、推理运行时和分布式部署方案,将该模型引入多节点部署环境。

在无需额外模型调优的情况下,该模型在NVIDIA GB300 NVL72平台上以FP8精度运行,从第一天起即可实现每GPU超4000 Token/秒的吞吐量,以及每用户超350 Token/秒的速率。预计未来引入NVFP4精度等进一步优化后,性能将持续提升。

Qwen3.8-2.4T-A95B专为最苛刻的智能体工作负载而构建,包括代码生成、大规模文档分析和长时多步骤工作流。与以单轮对话为主的模型不同,智能体应用会在整个工作流中持续积累系统指令、工具输出、检索文档、代码、日志和多步推理轨迹。随着上下文不断增长,注意力计算、算力和KV缓存内存将成为核心瓶颈。

全注意力与线性注意力的混合架构正是为此而设计。在全注意力层中,每个Token关注所有其他Token;在线性注意力层中,不断增长的KV缓存被替换为有界的循环状态。这使Qwen3.8-2.4T-A95B在上下文扩展至100万Token时,仍能将计算量和内存占用控制在可控范围内。

细粒度MoE架构让2.4万亿参数的部署在实际场景中变得可行。与少量大型专家的设计不同,该架构将容量分布于数量更多、规模更小的专家之间,在每单位激活算力下提升了专业化程度和路由效率。通过学习路由器,每个Token仅激活所需的专家,服务成本随激活参数而变化,而非全量2.4万亿参数,以极低的成本实现了与同等量级稠密模型相当的前沿能力。

内置推理控制选项(低/高/超高)允许开发者按需配置每次请求的推理深度,在算力与推理质量之间灵活权衡:面对复杂多步推理任务时可调高强度,面对高吞吐文档处理时可降低强度。

GB300 NVL72采用机架级架构,将72颗NVIDIA Blackwell Ultra GPU集成于单一平台。其大规模72-GPU NVIDIA NVLink域以130 TB/s的带宽支持高效的全互联通信,消除了专家流量跨越传统网络时产生的瓶颈。

开箱即用,Qwen3.8 2.4T-A95B在NVIDIA Blackwell GB300 NVL72上可实现每GPU超4000 Token/秒、每用户超350 Token/秒的性能,使AI工厂能够以高吞吐、低延迟的方式在生产环境中运行大参数模型。

NVIDIA支持多种推理栈以满足不同开发者需求。SGLang、vLLM和NVIDIA Dynamo为需要对NVIDIA加速平台进行更精细性能控制的开发者提供了开源推理方案。

此外,该模型也可通过无模型绑定的NVIDIA NIM进行部署——这是一个可服务任意受支持模型的单一推理容器。从第一天起即可下载模型权重并完成部署,支持微调检查点的直接服务,并可扩展至生产规模。

开发者可使用NVIDIA NeMo AutoModel对模型进行特定领域的后训练,这是一款基于PyTorch原生的微调库,第一天起即支持Hugging Face检查点。无需模型转换,直接在现有检查点上训练,支持完整SFT或内存高效的LoRA微调。

用户可从Hugging Face或ModelScope下载Qwen3.8-2.4T-A95B模型权重,并通过NVIDIA NGC上的无模型绑定NVIDIA NIM进行部署。

Q&A

Q1:Qwen3.8-2.4T-A95B模型有多大,架构有什么特点?

A:Qwen3.8-2.4T-A95B共有2.4万亿参数,每个Token激活95B参数。它采用细粒度混合专家(MoE)架构,结合全注意力与线性注意力的混合机制,上下文窗口最长支持100万Token,输出长度最高128K,专为高强度推理和智能体工作负载设计。

Q2:Qwen3.8-2.4T-A95B在NVIDIA GB300 NVL72上的实际推理性能怎么样?

A:在无需额外调优的情况下,模型以FP8精度运行,每GPU可实现超4000 Token/秒的吞吐量,每用户超350 Token/秒。未来引入NVFP4精度等优化后,性能预计还会进一步提升。GB300 NVL72集成72颗Blackwell Ultra GPU,NVLink域带宽达130 TB/s,为大规模推理提供硬件保障。

Q3:开发者如何部署和微调Qwen3.8-2.4T-A95B?

A:开发者可从Hugging Face或ModelScope下载模型权重,通过NVIDIA NGC上的NVIDIA NIM容器一键部署,支持从第一天起直接服务微调检查点。如需领域定制,可使用NVIDIA NeMo AutoModel进行后训练,支持完整SFT或LoRA微调,无需模型格式转换。SGLang、vLLM和NVIDIA Dynamo也提供开源推理方案供开发者选择。

NVIDIA