英特尔发布了OpenVINO 2026.3,对其开源AI推理工具包进行了更新,带来更广泛的模型支持、全新生成式AI流水线、内存效率提升以及更强的硬件兼容性。

新版本新增了对SmolLM3-3B、LFM2-1.2B和LFM2.5-1.2B的支持,覆盖英特尔CPU、GPU和NPU。此外,Harrier OSS-v1-0.6B、搭配EAGLE-3的Qwen3-8B、MiniCPM5-1B和FLUX.2-klein-4B也已支持在CPU和GPU上运行。YOLO26的支持范围进一步扩展至英特尔GPU和NPU,另有多个模型以早期预览版形式提供。本次更新还兼容Hugging Face Transformers 5.5。

OpenVINO GenAI将EAGLE-3推测解码流水线的支持范围扩展至大语言模型和视觉语言模型。更新新增了Top-K采样功能,并在持续批处理的基础上进一步提升了CPU、GPU和NPU上的Token生成性能。三条全新GenAI流水线分别支持多模态Omni任务、自动语音识别和多模态嵌入生成。

针对内存受限的部署场景,OpenVINO 2026.3引入了混合专家模型的磁盘卸载功能。英特尔表示,这使Qwen3-30B-A3B等300亿参数的MoE模型能够在仅有16GB内存的系统上运行。Linux平台新增懒加载权重支持,通过避免不必要的模型数据复制来降低峰值内存占用。神经网络压缩框架新增了针对ONNX模型的FP8量化功能。

本次更新还引入了对英特尔至强6+处理器的支持。OpenVINO模型服务器新增统一REST端点和标准v1/chat/completions端点,并对大语言模型服务的稳定性、性能及工具解析器支持进行了优化。

上述改进面向边缘、本地和云端的推理部署场景,重点在于让更新的生成式和多模态模型能够在异构英特尔硬件上高效运行。开发者可借助该工具包在支持的处理器类型上优化和部署模型,同时保持统一的开发框架。

更多详情可参阅OpenVINO 2026.3发布说明,开发者也可查阅系统要求并从英特尔官网下载OpenVINO。

Q&A

Q1:OpenVINO 2026.3新增了哪些模型支持?

A:OpenVINO 2026.3新增支持SmolLM3-3B、LFM2-1.2B、LFM2.5-1.2B,可在英特尔CPU、GPU和NPU上运行。CPU和GPU还新增支持Harrier OSS-v1-0.6B、Qwen3-8B(含EAGLE-3)、MiniCPM5-1B和FLUX.2-klein-4B。YOLO26的支持范围也扩展至GPU和NPU,同时兼容Hugging Face Transformers 5.5。

Q2:OpenVINO 2026.3的磁盘卸载功能有什么用?

A:磁盘卸载功能专为内存受限的部署场景设计,允许混合专家模型将部分数据卸载至磁盘。以Qwen3-30B-A3B为例,该300亿参数的MoE模型原本对内存要求极高,借助此功能可在仅有16GB内存的系统上正常运行,大幅降低了硬件门槛。

Q3:OpenVINO GenAI在Token生成方面有哪些改进?

A:OpenVINO GenAI将EAGLE-3推测解码流水线扩展至大语言模型和视觉语言模型,新增Top-K采样,并在持续批处理基础上提升了CPU、GPU和NPU上的Token生成性能。此外还新增三条流水线,分别支持多模态Omni任务、自动语音识别和多模态嵌入生成。

Edge AI and Vision Alliance - Latest News