由前OpenAI首席技术官米拉·穆拉蒂创立的旧金山初创公司Thinking Machines Lab,正式发布了其首款通用AI模型Inkling。此次发布,为开源权重市场新增了一个美国研发的竞争者——此前该市场的多款领先编码与推理模型主要来自中国开发者。
Inkling采用混合专家架构,总参数量达9750亿,其中在处理过程中激活的参数为410亿。该模型支持最高100万Token的上下文窗口,预训练数据涵盖文本、图像、音频和视频,共计45万亿Token。Thinking Machines表示,该模型还针对编码、工具调用和多模态任务进行了专项训练。
此次发布距Tinker上线仅数月。Tinker是Thinking Machines于2025年10月推出的首款产品,是一个基于API的AI模型定制平台,开发者可通过该平台对Inkling进行微调。
AI模型路由平台OpenRouter在2026年6月的评估报告中,重点提及了DeepSeek V4 Flash、GLM 5.2、MiniMax M3以及英伟达Nemotron 3 Ultra四款值得关注的开源权重模型,其中仅Nemotron来自美国。
Thinking Machines Lab公布的基准测试结果呈现出喜忧参半的态势。Inkling在SWE-Bench Verified上得分77.6%,低于DeepSeek V4 Pro和GLM 5.2,但高于英伟达Nemotron 3 Ultra。此外,Inkling在MCP Atlas上得分74.1%,在BrowseComp(含上下文管理)上得分77.1%,在IFBench上得分79.8%。
Thinking Machines指出,Inkling的测试结果采用的是仅限bash的测试工具,而对比模型的数据则来自各自开发商自行报告的数字。
该模型内置推理力度调节功能,开发者可在0.2至0.99之间灵活设置。Thinking Machines表示,此设置允许用户在性能与生成Token数量之间取得平衡。在公司内部测试中,Inkling在Terminal Bench 2.1上与Nemotron 3 Ultra达到相同得分,但生成的Token数量仅为后者的约三分之一。
开发者可通过Tinker平台对Inkling进行微调,支持64,000或256,000 Token的上下文长度,并可通过Inkling Playground进行测试。该模型已通过Together AI、Fireworks、Modal、Databricks和Baseten的API提供调用,同时兼容SGLang、vLLM、TokenSpeed、llama.cpp和Hugging Face Transformers等推理软件。
Inkling的完整权重文件已在Hugging Face上以原始检查点和量化NVFP4检查点两种形式开放下载。Thinking Machines还预告了参数更小的Inkling-Small版本,其总参数量为2760亿,激活参数为120亿,公司表示将在完成测试后发布该小型模型的完整权重。
Forrester首席分析师Biswajeet Mahapatra指出,Inkling的差异化优势在于其开放权重、多模态能力、可控推理机制以及与Tinker平台的深度集成,而非基准测试上的领先地位。
"企业在领域适配能力比通用模型性能更重要的工作场景中,最有可能从中获益,这些场景包括知识密集型智能助手、多模态客户服务、文档理解、运营工作流自动化,以及需要调用组织专属数据、策略与流程的智能体任务。"Mahapatra表示。
Pareekh咨询公司CEO Pareekh Jain认为,Inkling的美国产地属性同样会对西方企业的采用决策产生影响。他表示,许多西方组织在考虑使用中国开发的AI模型时,面临监管或采购方面的障碍。
"Inkling为这些组织提供了一个可部署在自有基础设施上的美国开发的开源权重选项。"Jain说。
然而,这些优势需要与部署完整模型的成本相权衡。
根据模型说明文档,在私有基础设施上运行Inkling,BF16检查点需要至少2TB的聚合显存,Thinking Machines列出的参考配置为8块英伟达B300 GPU或16块H200 GPU。量化NVFP4检查点可将显存需求降至600GB以上,仅需4块B300或8块H200即可运行。
"由于Inkling是一个拥有9750亿总参数的超大型模型,运行完整版本仍需相当可观的GPU基础设施投入,这使得对许多组织而言,闭源模型API在经济性上更具优势。"Jain说。
Jain认为,Inkling-Small对许多企业来说可能是更具可行性的选择,因为它能在保持关键工作负载性能的同时,有效降低基础设施成本和推理延迟。
Thinking Machines表示,Inkling在训练中注重校准性、指令遵循能力和抗审查能力。公司称,Cognition在其"宣传与审查评估"测试中,发现该模型表现出"强烈的抗审查合规倾向"。
Inkling在StrongREJECT测试中得分98.6%,Thinking Machines将其描述为一项考察模型是否拒绝明确有害请求的测试。
Jain提示,企业在对模型进行定制化调整后,应重新对其安全行为进行测试。"模型微调可能削弱安全过滤机制,因此企业在定制模型后应重新进行安全测试,而不能想当然地认为其仍然安全。"他补充说,自托管和经过修改的版本可能会随时间推移逐渐偏离Thinking Machines官方版本,且无法自动接收更新。
"CIO们需要确保每一个AI智能体的操作都有日志记录、可审计,并在高风险任务上受到人工审批的约束。"Jain说。
Q&A
Q1:Inkling模型的架构和参数规模是怎样的?
A:Inkling采用混合专家架构,总参数量达9750亿,处理时激活参数为410亿。它支持最高100万Token的上下文窗口,预训练数据涵盖文本、图像、音频和视频,共计45万亿Token,并针对编码、工具调用和多模态任务进行了专项训练。
Q2:在私有基础设施上部署Inkling需要什么样的硬件配置?
A:运行Inkling完整的BF16版本,至少需要2TB聚合显存,参考配置为8块英伟达B300 GPU或16块H200 GPU。如使用量化NVFP4版本,显存需求可降至600GB以上,仅需4块B300或8块H200即可运行。对于许多组织而言,硬件成本较高,使用闭源模型API在经济上可能更划算。
Q3:企业对Inkling微调后还需要注意哪些安全问题?
A:模型微调可能削弱其内置的安全过滤机制,因此企业在完成定制化调整后必须重新进行安全测试,不能默认模型仍保持原有的安全行为。此外,自托管和修改后的版本无法自动接收官方更新,可能随时间推移逐渐偏离原始版本。CIO需确保智能体操作均有日志记录、可被审计,并对高风险任务设置人工审批环节。
