小米公司今日宣布发布并开源其MiMo-V2.6系列生成式AI模型,该系列包含两款原生全模态模型,在智能水平、效率和成本方面实现了平衡。
MiMo-V2.6系列包含两款原生全模态模型:全新旗舰模型MiMo-V2.6-Pro,以及一款更小巧高效的Flash变体。该公司还表示,正在推出一款精简版的Pro-UltraSpeed变体,在同等质量下输出速度最高可达Pro版本的20倍,实现极致生成速度。
该公司将Pro和Flash模型描述为原生"全模态"模型:在同一系列中可接受文本、图像、视频和音频输入,并拥有100万Token的上下文窗口。Pro模型公布的架构显示,其拥有一个6.81亿参数的视觉编码器,其中包括一个3.08亿参数的AudioTokenizer和1.27亿参数的音频块编码器,能够识别语音。
这一设计使得大型模型能够满足当下日益增长的智能体AI应用场景和任务指令需求,尤其是在计算机操作方面。例如,一个计算机操作智能体可以读取任务指令、读取用户界面截图或视频、进行推理,然后在同一个模型循环中决定下一步该做什么。
编程或设计智能体可以在同一会话中,将源代码、冗长的代码仓库上下文与截图、UI设计稿和参考图像结合在一起。在商业应用中,该模型可以处理大量文档,包括通话音频、截图、日志和笔记等多模态内容,而无需借助工具来拆解转录内容或协调各个模态。
在发布公告博文中,该公司展示了这款模型在游戏世界构建、基于Blender的3D建模、具身仿真以及视频-音乐工作流方面的出色表现。
该公司表示,V2.6-Pro在Artificial Analysis智能指数上得分46.32,超过了Kimi K3和Qwen3.8 Max,成为发布时该项对比中排名最高的开源/开放权重模型。不过,该模型在综合指标上仍落后于市场上最先进的闭源旗舰模型Claude Fable 5.1和GPT-6 Astra。
在智能体任务方面,V2.6-Pro在测试中表现强劲,接近甚至偶尔超越领先的闭源系统:在AutomationBench上得分53.1,高于Claude Opus 5的50.3分;在Agents' Last Exam上得分31.6,与Opus 5持平;在Terminal Bench 2.1上得分89.9,略高于Opus 5的89.1分。
成本效益优势
小米表示,V2.6系列将延续MiMo-V2.5所采用的标准API定价,模型卡片同时显示该模型可通过公司的AI Studio、MiMo Desktop和MiMo Code等渠道使用。
Pro和Flash模型还可通过OpenRouter平台以统一API的形式使用,支持105万Token的上下文。
这意味着V2.6-Flash的定价为每百万输入Token 0.14美元、输出0.28美元,Pro版本为输入0.435美元、输出0.87美元。而Pro-UltraSpeed版本由于生成速度提升20倍,价格一路升至输入4.35美元、输出8.70美元。
小米方面称,在考虑到大幅降低的缓存Token成本后,Pro模型在同等智能水平下的成本大约仅为海外模型的二十分之一到六十分之一。相比之下,OpenAI Group PBC的GPT-6 Astra和Anthropic PBC的Claude Fable 5.1每百万Token输入输出价格为10至50美元。对于大量使用缓存的智能体而言,这一差距会进一步拉大,不过相关的商业比较更多应关注单次任务成本,而非单个Token价格,这取决于任务的可靠性以及成功完成任务所需的循环次数。
Q&A
Q1:MiMo-V2.6系列包含哪些模型?
A:MiMo-V2.6系列包含两款原生全模态模型,分别是旗舰模型MiMo-V2.6-Pro和更小巧高效的Flash变体,另外还推出了速度更快的Pro-UltraSpeed变体,输出速度最高可达Pro版本的20倍。
Q2:MiMo-V2.6-Pro的智能水平表现如何?
A:MiMo-V2.6-Pro在Artificial Analysis智能指数上得分46.32,超过Kimi K3和Qwen3.8 Max,是发布时排名最高的开源模型,但在综合指标上仍落后于Claude Fable 5.1和GPT-6 Astra等闭源旗舰模型。
Q3:MiMo-V2.6系列的价格如何?
A:V2.6-Flash每百万输入Token为0.14美元、输出0.28美元;Pro版本输入0.435美元、输出0.87美元;Pro-UltraSpeed版本输入4.35美元、输出8.70美元,整体成本远低于海外同类模型。
