谷歌发布Gemma 4 12B模型,专为笔记本电脑设计,填补E4B与26B混合专家模型之间的空白。该模型采用无编码器统一架构,视觉与音频输入直接接入LLM主干网络,无需独立编码器,有效降低延迟和内存占用。仅需16GB显存即可本地运行,支持多步推理和智能体工作流,并首次支持原生音频输入。模型基于Apache 2.0协议开源,Gemma 4系列累计下载量已突破1.5亿次。
微软发布硬件高效推理模型Phi-4-reasoning-vision-15B,可处理科学图表等多模态文件。该模型基于SigLIP-2和Phi-4 Reasoning算法,采用中融合技术降低硬件需求。模型主要使用开源数据训练,并通过GPT-4o优化图像标注。在MathVista_Mini基准测试中,性能比谷歌同类模型高出17%。可用于构建AI代理,分析用户界面和科学图表,代码已在多个平台开源。
Liquid AI发布了新一代视觉语言基础模型LFM2-VL,专为智能手机、笔记本电脑和嵌入式系统等设备高效部署而设计。该模型基于独特的LIV系统架构,GPU推理速度比同类模型快2倍,同时保持竞争性能。提供450M和1.6B两个版本,支持512×512原生分辨率图像处理,采用模块化架构结合语言模型和视觉编码器。模型已在Hugging Face平台开源发布。
微软推出了新一代高效 AI 模型 Phi-4,可同时处理文本、图像和语音,且计算资源需求大幅降低。其中 Phi-4-Multimodal 仅有 56 亿参数,Phi-4-Mini 仅有 38 亿参数,性能却超越同等规模竞品,甚至在某些任务上媲美两倍大小的模型。这一突破性进展为开发者提供了先进的 AI 能力,有望推动边缘计算和普及 AI 应用。
OpenAI 推出名为 Operator 的 AI 代理,可自动执行用户任务。与此同时,主要竞争对手 Perplexity AI 和 Anthropic 也宣布了产品更新。Perplexity AI 在其 Android 应用中引入类似功能,而 Anthropic 则推出了改进 AI 模型引用能力的工具。这些动作反映了 AI 服务领域的激烈竞争和快速发展。