IBM近日推出了其开放权重大语言模型家族的最新成员——Granite 4.2系列,支持下载和自托管部署,提供3B、8B和30B三种参数规模。

与前代版本一致,Granite 4.2沿用纯解码器架构,原生支持128,000个Token的上下文窗口。其中8B和30B版本(3B版本除外)还经过了智能体强化学习模块的训练,具备使用终端、搜索网络或调用外部工具等扩展能力。3B模型同样支持工具调用,但缺乏相同程度的专项训练。

此次发布最值得关注的一点,正如IBM官方所述:"Granite 4.2是Granite大语言模型家族中专注于推理能力的版本。"

这里所说的"推理能力",并非指模型具备类似人类的意识理解,而是指功能性推理——尤其是通过"思维链"方式,将中间结果跨多个步骤逐步传递。对用户而言,这意味着在某些场景下能获得更严谨、准确的回答,但通常也伴随着更慢的响应速度和更高的计算资源需求。

IBM的Granite系列模型在速度或创新性方面向来鲜少引发轰动。相较于英伟达Nemotron等本地企业级市场的竞争对手,Granite的核心卖点在于可预期的稳定部署——这与IBM当前的战略重心不谋而合。

近期,围绕Anthropic、OpenAI等公司前沿云端模型的成本与算力压力,业界讨论持续升温。在众多领域,无论是独立开发者还是企业机构,都在积极探索本地模型作为更具成本效益的替代方案。

这一趋势也推动了模型路由器的关注度提升——这类AI工具的核心职能是解析用户提示、任务或项目需求,并将其分配至适配规模的模型,从而在性能、速度与成本之间实现最优平衡。

此类模型同样深受AI爱好者、研究人员和个人开发者的青睐,因为他们可以在本地硬件上自由探索,无需承担按Token计费的API费用。

Q&A

Q1:IBM Granite 4.2的3B、8B、30B三个版本有什么区别?

A:三个版本的核心区别在于参数规模和训练深度。8B和30B版本经过智能体强化学习模块的专项训练,具备使用终端、搜索网络、调用外部工具等扩展能力;3B版本虽然也支持工具调用,但缺乏同等程度的专项训练。所有版本均原生支持128,000个Token的上下文窗口,并采用纯解码器架构。

Q2:Granite 4.2所说的"推理能力"具体是什么意思?

A:这里的推理能力并非指模型具备人类式的意识理解,而是指功能性推理,核心机制是"思维链"——模型能够将中间步骤的结果逐步传递,完成多步骤复杂任务。这带来的实际效果是回答更严谨、更准确,但代价是响应速度可能变慢,对计算资源的需求也会相应提高。

Q3:为什么现在越来越多的开发者和企业开始关注本地大语言模型?

A:主要原因是成本和算力压力。Anthropic、OpenAI等公司的前沿云端模型费用较高,本地模型提供了更具成本效益的替代方案,不需要按Token付费,可在本地硬件上自由部署和调试。此外,本地模型还催生了"模型路由器"的需求,帮助在性能、速度和成本之间找到最优平衡。

ArsTechnica - AI