阿里巴巴近日公开发布了其拥有2.4万亿参数的Qwen3.8模型权重。这是一个体量极为庞大的模型,其基准测试成绩使其直接跻身与美国顶级实验室闭源前沿模型同台竞争的行列。然而,同样引人注目的是,上周五,阿里巴巴还在Apache 2.0许可协议下,发布了一个拥有270亿参数的Qwen3.8稠密版本。
这个版本可以在配置较好的MacBook Pro或Mac Studio等设备上本地运行。而且,根据阿里巴巴的基准测试数据,这款模型的性能与Anthropic的Opus 4.6在最高(Max)设置下处于同一水平,这使其更具吸引力。
在相当多的基准测试项目上,该模型甚至超越了Anthropic昔日的旗舰产品——那款于今年二月发布、半年前还代表着业界最高水准的模型。尤其是在计算机操作、代码生成和知识工作类测试中,表现尤为突出。
此外,该模型还具备视觉能力,包括视频理解,这进一步增强了其作为本地部署方案的吸引力——前提是用户拥有足够的硬件支持。
当然,一如既往地,基准测试成绩并不总能反映模型在真实场景中的表现,对于智能体应用场景而言,运行框架本身的质量有时与模型本身同样重要。早期反馈也指出,该模型有过度思考的倾向。
同时值得注意的是,阿里巴巴发布的基准测试数据针对的是原始检查点(checkpoint),而非大多数本地用户实际运行的量化版本。量化处理虽然能让模型在消费级硬件上运行,但不可避免地存在性能损耗。
尽管如此,整体而言,一款可以在本地运行的模型能取得如此成绩,已属相当亮眼。
阿里巴巴指出,该模型在代码生成和知识工作等任务上,相较上一代的Qwen3.7-Plus实现了大幅跃升,部分提升幅度尤为显著——例如在DeepSWE智能体编程基准测试上,得分从14.2分跳升至42.2分。
这一成绩虽仍落后于当前最顶尖的前沿模型(以及最新发布的GLM-5.3等其他开源模型),但即便是谷歌中端产品Gemini 3.6 Flash在该测试中也仅获得49%的成绩,而那款模型根本无法在个人笔记本电脑上本地运行。
阿里巴巴还将该模型与Meta的Muse Glimmer-30B进行了横向比较,后者也是近期发布的体量相近的本地模型。在阿里巴巴公布了两者对比数据的所有测试项目中,Qwen3.8-27B均处于领先地位。
推理速度是另一个需要关注的维度。目前,阿里巴巴尚未发布Qwen3.8 27B的混合专家(MoE)轻量版本。此类模型每个Token激活的参数量更少,运行速度更快。阿里巴巴此前曾为Qwen3.6-35B推出过类似的轻量版本。
未量化的Qwen3.8-27B模型文件本身已有55.6GB,还不包括推理运行时和上下文缓存所需的空间,这并非大多数用户的实际运行方案。
对于Mac用户而言,好消息是社区已经创建了适配Apple Silicon的MLX转换版本。4位量化版本约为16.1GB,8位量化版本约为29.5GB。这意味着,搭载32GB统一内存的Mac设备在适中的上下文长度下,完全可以运行4位量化版本。如果内存达到48GB或64GB,则能够以更高精度处理更长的提示词,效果会更好。
该模型默认支持26.2万Token的上下文长度,通过YaRN方法可进一步扩展,阿里巴巴的云端托管版本已将其扩展至100万Token。不过,这并不意味着本地用户可以在桌面设备上使用完整的上下文窗口,因为随着提示词增长,键值缓存(KV Cache)的内存占用会显著增加。
Q&A
Q1:Qwen3.8-27B模型在本地运行需要什么硬件配置?
A:Qwen3.8-27B未量化版本体积为55.6GB,对大多数用户来说直接运行较为困难。社区已提供面向Apple Silicon的MLX转换版本,其中4位量化版约16.1GB,8位量化版约29.5GB。配备32GB统一内存的Mac在中等上下文长度下可流畅运行4位量化版本,若内存达到48GB或64GB,则能获得更高精度和更长的提示词处理能力。
Q2:Qwen3.8-27B的性能真的能和Anthropic Opus 4.6媲美吗?
A:根据阿里巴巴发布的基准测试数据,Qwen3.8-27B在多项测试中与Anthropic Opus 4.6处于同等水平,在部分编程、计算机操作和知识工作测试中甚至超越后者。但需注意,这些数据基于原始检查点,而非量化版本;且基准测试未必能完全反映真实场景表现。此外,早期用户反馈指出该模型存在过度思考的倾向。
Q3:Qwen3.8-27B支持多长的上下文窗口?
A:Qwen3.8-27B默认支持26.2万Token的上下文长度。通过YaRN方法可将其扩展至100万Token,阿里巴巴的云端托管版本已启用该扩展。但在本地设备上,受内存限制,实际可用的上下文长度会随提示词增长而受到制约,因为键值缓存会持续占用内存资源。
