DeepSeek今日推出其旗舰V4系列大语言模型的新成员。
V4 Flash Vision Exp目前仅通过DeepSeek付费开发者平台提供服务。考虑到该公司此前已开源多款早期模型,日后或将推出免费版本。这些开源模型中包括V4 Flash——一款于今年4月发布的算法,也是V4 Flash Vision Exp的基础版本。
DeepSeek通过七项文本基准测试对这两款大语言模型进行了比较。除名为Cybergym的基准测试外,V4 Flash Vision Exp在其余所有测试中均优于其前身。Cybergym专门用于评估大语言模型发现软件漏洞的能力。
V4 Flash Vision Exp性能提升最为显著的领域是图像分析。DeepSeek使用四项不同基准测试评估了该模型处理视觉内容的能力,其中两项测试的得分提升幅度超过10%。
值得关注的是,V4 Flash Vision Exp在ALE和ZeroBench两项视觉基准测试中同样超越了Anthropic的Opus 4.8。ALE包含逾1000个多步骤任务,要求大语言模型与应用程序交互、编写代码并解读媒体文件;ZeroBench则包含100项图像分析任务,专为对前沿大语言模型形成高难度挑战而设计。
DeepSeek目前尚未公开V4 Flash Vision Exp的架构信息,但其Hugging Face页面提供了V4 Flash模型的详细介绍。
V4 Flash是一款混合专家模型,拥有2840亿参数,由多个各含130亿参数的神经网络组成。当用户输入提示词时,该大语言模型仅激活最适合生成答案的神经网络,这一机制相较于激活整个模型所需的算力大幅降低。
大语言模型将用于回答提示词的信息存储在一种名为KV缓存的数据结构中。V4 Flash采用HCA和CSA两项技术对KV缓存进行压缩。据DeepSeek表示,这两项技术可将处理百万Token提示词所需的算力降低73%。
DeepSeek使用32万亿Token的训练数据对V4 Flash进行训练,并采用名为Muon的算法加速训练流程。Muon可缩短校准大语言模型隐藏层所需的时间,而隐藏层正是承担提示词响应中绝大部分处理工作的核心组件。
V4 Flash是DeepSeek于4月发布的两款大语言模型之一,另一款名为V4 Pro,其参数量是V4 Flash的五倍以上。鉴于V4 Flash Vision Exp衍生自V4 Flash,V4 Pro未来或许也将成为图像分析等专项任务优化模型的基础架构。
Q&A
Q1:V4 Flash Vision Exp和普通的V4 Flash有什么区别?
A:V4 Flash Vision Exp是在V4 Flash基础上开发的多模态版本,最大的升级在于图像分析能力。在四项视觉基准测试中,V4 Flash Vision Exp有两项得分提升超过10%,还在ALE和ZeroBench两项视觉测试中超越了Anthropic的Opus 4.8。文本能力方面,除软件漏洞发现测试Cybergym外,新模型在其余所有文本基准测试中也均优于前身。
Q2:V4 Flash模型的参数规模和技术架构是怎样的?
A:V4 Flash是混合专家模型,总参数量为2840亿,由多个各含130亿参数的神经网络组成。用户输入提示词时,模型只激活最合适的那个神经网络,而非整体运行,大幅节省算力。此外,V4 Flash采用HCA和CSA技术压缩KV缓存,处理百万Token提示词时可减少73%的算力消耗,训练则使用了32万亿Token数据。
Q3:V4 Flash Vision Exp现在可以免费使用吗?
A:目前V4 Flash Vision Exp仅通过DeepSeek的付费开发者平台提供,暂无免费版本。不过,DeepSeek此前已开源多款早期模型,因此未来推出免费版本存在较大可能性,但官方尚未作出任何承诺。
