阿布扎比人工智能基础模型研究院(IFM)上周推出了K2 Horizon系列模型。这组六款AI基础模型的参数量从9亿到3750亿不等,被称为迄今为止“规模最大的完全开源AI模型阵列”。

IFM所指的“完全开源”,其内涵远不止提供可下载的模型权重。针对K2 Horizon系列,该机构承诺公开训练与评估代码、可再分发的训练数据(若无法再分发则提供详细的构建方法),以及涵盖预训练到智能体后训练全过程的配置、日志和中间检查点。

其目的是让开发者能够审视模型的构建过程,复现其开发流程,并将其应用于自身工作。但这一承诺并不意味着发布之初就完全公开:这六款模型均可下载权重,但9亿、320亿参数以及旗舰版3750亿参数模型的模型卡说明中提到,部分训练数据、代码或检查点将在后续提供。320亿参数模型此次发布的也仅是第一阶段检查点,最终版本尚未到来。

“开源远不止于开放权重。当其他人能够看到数据、遵循方法、复现结果并进行改进时,科学才能真正发挥作用,”IFM创始人、穆罕默德·本·扎耶德人工智能大学教授埃里克·邢表示。“K2 Horizon满足了这一需求。该系列每一款模型都附带了训练数据、构建方法和评估结果。这就是开放科学,我们相信这是AI发展的最佳路径。”

开发者能想到的所有开源要素都涵盖了

IFM表示,正在为K2 Horizon系列每款模型开放完整的训练生命周期,从预训练到推理能力构建,再到智能体后训练。对每款模型,该机构均已发布或承诺发布中间检查点、训练数据或详细的数据构建方法。检查点是训练过程中保存的快照,可供研究人员检查模型的发展过程,并复现或从特定阶段恢复训练。更广泛的公开内容还包括架构细节、数据混合构成、训练代码、配置参数、精细日志、评估结果和最终权重。

K2 Horizon团队表示,在推理、数学、编程和智能体任务方面,系列中每种规模的模型表现均良好。9亿参数模型专为智能手表、智能眼镜等资源高度受限的环境设计,而37亿和70亿参数模型则将先进能力带入手机等端侧应用场景。

320亿参数的密集模型和360亿参数(激活参数40亿)的稀疏模型,为本地部署和本地服务器提供了更强的性能表现。3750亿参数(激活参数230亿)模型则为要求严苛的企业级部署场景带来了该系列最强的能力。

这六款模型共享核心架构、词表、训练方法、接口和部署工具,其中9亿参数模型的词表相对较小。IFM的动态模型路由技术能够将任务分配给性价比最优的模型,为开发者提供了从原型到生产的完整路径。该机构强调,完全公开的代码、训练数据和构建方法“在透明度方面迈出了重要一步”,其开放程度“远超”今年主导AI行业话题的开放权重讨论。

这样的开放程度还能更彻底吗

IFM团队显然希望通过全方位的开放性实现差异化,但这种开放是否还能做得更彻底?未来是否还需要更进一步?

要回答这个问题,需要注意各模型在发布时的开放程度并不一致。37亿和70亿参数模型发布时即附带了完整的组件集,包括权重、构建方法、训练代码和数据;而9亿参数模型的模型卡(即描述模型能力和局限性的文档)中提到,其数据和代码仍在筹备中。旗舰版3750亿参数(激活230亿)模型和稀疏版360亿参数(激活40亿)模型最初发布时仅提供最终权重,完整训练代码、原始数据集和中间检查点承诺在后续更新中提供。320亿参数模型则以未完成的第一阶段检查点形式发布,最终版本和其余组件仍待公开。

但真正关乎开放纯度的问题,其实在于模型训练中更细微的层面,而这正是让开发者感到欣喜或恼火的关键所在。如果每种规模模型公开的数据以及合成数据生成流程无法完全复现,AI工程师大概不会满意。

AI超级应用公司CellCog创始人兼CEO尼提什·加尔格在分析K2 Horizon及其模型训练流程时表示:“数学推理链被重写成对话和学习指南的形式,混入了预训练数据中,而非留作后训练使用。计算资源方面则完全没有披露:没有加速器数量、没有训练时长、没有成本信息。对于一个以‘可审视性’为核心主张的发布而言,这是一个明显的漏洞,而后续到来的精细训练日志或许能够弥补这一缺口。”

不可能完成的复现任务:开源模型需要公开哪些内容

从这一叙事来看,发布合成数据集本身是件好事。但如果开放的前沿模型公司发布合成数据集时,不同时提供完整的生成器提示词(即引导AI模型生成合成训练数据的文本输入)、种子代码(顾名思义,即控制并启动数据集生成过程的核心代码),或精确的过滤规则(用于清理或剔除低质量合成数据),那么开发者会发现真正的端到端复现依然困难重重,某些情况下甚至根本无法实现。

进一步而言,IFM表示已经公开了方法论,但开发者还会要求更具体的执行细节,包括运行复杂模型所用硬件拓扑的精确信息。工程师们也希望看到分布式通信配置,以便研究并行处理器在训练过程中如何交换数据。此外还需要优化器状态记录,即追踪每次训练迭代中模型优化进展的参数。

围绕这一话题公开讨论的开发者们并未有所保留。不过,讨论的焦点很快从K2 Horizon转向了中国实验室——它们已成为开放权重模型的重要供应方,尽管其训练数据和完整训练技术栈通常仍处于闭源状态。

针对一位用户声称“如今中国的模型甚至不再发布预训练权重了”,开发者能拿到的只是训练完成后的最终产品,用户culi反驳道:“不,这完全不是事实。Qwen、GLM、Kimi、DeepSeek等模型始终会同时发布经过后训练的‘指令/对话’版本以及底层的‘基础’(预训练)权重。”

加入讨论的Hacker News用户thepasch认为,确实存在真正的开放权重,但这种开放也存在局限。“推理代码,是的,可以公开;但它们训练过程的具体细节(以及绝大多数其他开放权重模型的训练过程)仍然是一个彻底的黑箱,我想不出有哪个中国模型公开过其训练语料库。”

我们才是开源中的全方位开源

在近期一次视频采访中(第6分51秒),IFM硅谷实验室主管刘赫克特表示:“最近,人们对‘开源’这个词有些困惑。有些人开放了最终模型的权重,但不会让你了解训练是如何进行的,产品是如何完成的……所以在IFM,我们是360度开源,或者说完全开源的先行者。”

他还表示,开发者可以在最小规模的模型上进行原型开发,扩展到旗舰模型,并沿途验证IFM所做的每一项声明。并非人人都真正理解不同开源方式之间的区别,这一点本不该令人意外。但这里所展现出的认知差距,确实清晰可见。

模型权重已在Hugging Face平台发布,发布当日即支持vLLM和SGLang推理框架。K2 Horizon API可通过IFM的推理合作伙伴获取,包括Compass、Cerebras和Nebius。K2 Horizon系列模型和代码均以Apache 2.0许可证发布。

Q&A

Q1:K2 Horizon是什么?包含哪些模型?

A:K2 Horizon是阿布扎比人工智能基础模型研究院(IFM)推出的一系列开源AI基础模型,共六款,参数量从9亿到3750亿不等,被称为“最大的完全开源AI模型阵列”。

Q2:K2 Horizon的“完全开源”具体指什么?

A:不仅指开放模型权重,还包括训练和评估代码、训练数据或构建方法、配置文件、日志以及涵盖预训练到智能体后训练全过程的中间检查点。

Q3:开发者对K2 Horizon的开放程度有什么质疑?

A:有开发者指出,部分模型发布时数据、代码或检查点并未完全公开,且计算资源信息(如加速器数量、训练时长和成本)完全未披露,影响了真正的端到端可复现性。

The New Stack