阿里巴巴于周一正式推出Qwen3.8-Max,这是其迄今为止规模最大的人工智能模型,也是其企业AI产品组合的最新扩充。该模型采用开放权重设计,面向软件工程、多模态推理及其他知识密集型商业场景。
阿里巴巴在发布博客中将Qwen3.8-Max定位为一款拥有2.4万亿参数的混合专家(MoE)模型,在推理过程中仅激活约950亿参数。阿里巴巴表示,该架构旨在提升推理效率,同时支持编程、推理和多模态任务,开放权重版本将于下周通过阿里云模型工场正式发布。
阿里巴巴在X平台发文称:"我们认为这是当今最强大的模型之一,可与前沿AI顶尖模型媲美,仅次于Fable 5。"
阿里巴巴公布了内部测试结果,在SWE-bench Pro及其自有评测基准NL2Repo-Bench等编程测试中,Qwen3.8-Max与Claude Opus 4.8、Claude Fable 5及OpenAI的GPT-5.6 Sol进行了对比。测试中,阿里巴巴分别采用各厂商自己的编程工具框架——Anthropic模型使用Claude Code,GPT-5.6 Sol使用Codex——并取各竞品在所有配置中的最高公开得分进行比较。
弗雷斯特研究公司副总裁兼首席分析师查理·戴表示,此次发布标志着阿里巴巴正在缩小与闭源头部模型的差距,但这只是故事的一部分。他说:"阿里巴巴在缩小差距,但更大的背景是开放权重模型的快速成熟。企业在软件工程、领域定制、数据主权和成本敏感型部署场景中,拥有越来越多可信赖的替代选择,开放性的重要程度往往不亚于模型的绝对性能。"
在能力验证层面,阿里巴巴表示,测试了该模型在三个无人监督、历时多天的编程项目中的表现,要求模型从空项目文件夹独立完成整个任务,其中一个项目耗时16天全程无需人工干预。阿里巴巴还着重介绍了该模型在法律合规、财务分析、工程设计、量化研究和多模态内容创作等企业场景中的应用,强调模型旨在完成完整业务流程,而非仅辅助单一任务。
然而,Kanerika公司AI开发经理阿米特·杰纳对此提出了质疑:"真正值得深究的不是参数量。阿里巴巴声称模型独立完成了一个耗时16天的软件工程项目,这句话被到处转载,却没有人追问细节——16天里到底发生了什么?人工介入了几次?输出结果通过代码审查了吗?"
杰纳还表示,对于"开放权重"的承诺也应仔细甄别:"发布权重和开放API接口是两回事。在代码仓库、许可证和模型说明卡正式公开之前,'开放权重'描述的只是一种意向。"
在架构与成本方面,Qwen3.8-Max的混合专家架构每次请求仅激活约950亿参数,阿里巴巴表示这有助于降低推理成本。查理·戴指出,这一权衡对企业采购决策的影响已超过对模型规模的关注:"推理效率对大多数企业来说,现在比原始模型规模更重要。仅激活总参数的一小部分,可以显著降低服务成本和基础设施需求,让生产级部署更易获得前沿性能,而可扩展性、延迟和经济性往往比基准测试排名更关键。"
Gartner高级首席分析师尼提什·泰亚吉则认为,此次发布的意义不在于参数数量,而在于它所传递的市场信号——AI部署成本正面临更大竞争压力。他表示:"Gartner此前预测,若缺乏有效的成本管控,AI编程费用可能超过一名普通开发者的年薪。开放权重、混合专家架构与百万Token上下文窗口的组合,是推动AI辅助软件开发走向经济可行性的重要一步。"
泰亚吉同时提醒企业,在评估模型时不应只看推理成本:"许多中国以外的企业可能对将模型托管在中国境内持谨慎态度,因而倾向于通过超大规模云服务商或本地基础设施部署,两者都会带来额外成本。"他还指出,开放权重模型通常缺乏商业AI厂商提供的知识产权赔偿保障,企业需要建立自己的安全、治理和代码扫描机制,在投入生产前规避版权和知识产权风险。
杰纳还补充道,周一发布的旗舰模型未必是企业最终会采用的版本。他认为,与旗舰版同步发布却几乎被忽视的Qwen3.8-27B,对大多数企业而言反而是更易落地的选择,因为它可以运行在自有基础设施上,并针对自有数据进行微调。
查理·戴最后建议,企业在评估此次发布时,应将透明度和总拥有成本置于头条数字之上:"核心问题是:与竞争模型相比,Qwen3.8是否能带来可量化的业务成果、企业级可靠性、更低的总拥有成本,以及数字主权方面的选择空间?"
Q&A
Q1:Qwen3.8-Max的混合专家架构有什么优势?
A:Qwen3.8-Max拥有2.4万亿总参数,但每次推理仅激活约950亿参数。这种混合专家(MoE)架构的核心优势在于大幅降低推理成本和基础设施需求,使企业能够以更低代价获得前沿模型性能。分析师指出,对大多数企业而言,推理效率的重要性现已超过原始参数规模,尤其在对可扩展性、延迟和成本敏感的生产环境中,这一设计更具实际价值。
Q2:阿里巴巴声称Qwen3.8-Max独立完成了16天的编程项目,可信吗?
A:这一说法受到业内人士的质疑。Kanerika公司AI开发经理阿米特·杰纳指出,"16天完成项目"的表述被广泛转载,却几乎没有人追问具体细节:这16天里人工介入了几次?最终输出是否通过了代码审查?他认为,在缺乏透明评测方法的情况下,这一数据难以独立核实,应保持审慎态度。
Q3:企业在中国境外部署Qwen3.8-Max时,需要注意哪些风险?
A:主要有两方面风险。一是部署成本问题:许多企业出于数据主权考量,不愿将模型托管在中国境内,转而选择超大规模云服务商或本地基础设施,这会带来额外费用。二是知识产权保障缺失:开放权重模型通常不提供商业AI厂商的赔偿保障,企业需要自行建立安全、治理和代码扫描机制,在上线前规避版权风险。
