过去一周,AI 圈有一个绕不开的名字, DeepSeek V4.1 Flash。

9 月 8 日,DeepSeek 先在交流群里放出限时内测,10 号正式上线。总参数 552B,MOE模型,输入启动8B,输出16B,跑得快、成本低,完全开源,部署毫无难度。

价格依然很诱人,非高峰时段,每百万 token 输入 1 块钱、输出 4 块,缓存命中的输入只要 2 分钱,高峰时段翻一倍。

这种价格基本表明Flash是一个走量的模型,但却被官方摆到了接班4.0 Pro 的位置上,这或许源自其不错的成绩。

在软件工程测试 DeepSWE 上,V4.1 Flash 拿了 74.2,相比的Claude Opus 5 是 74.0,GPT-5.6 Sol 是 73.0,V4.1 Flash又一次排在了两家顶级闭源模型的前面。

不过在专家级学科知识的 Humanity's Last Exam的评测上,它只有 36.8,比Claude Opus5少了近 20 分。

分数一出来,国内外的博主几乎同时开测。

国内被打动的是价格和速度,我印象中有篇实测,标题是"降价后熟悉的梁圣又回来了",当年 DeepSeek 靠价格掀桌子的那股劲,又让人想起来了。

内测刚开放就有大量自媒体晒对比,同一批任务,和之前的视觉实验版相比,生成 SVG 代码快了 6 倍,长文档检索快了 5 倍多,每秒三四百 token,字几乎是往外喷的。B 站上"吊打自家 Pro"这类标题,一搜一大把。

冷静一点的声音也有,一位 UP 主做完六项能力测试,只留了一句"好像有点不一样?",小红书上一篇实测的结论:道阻且长。

国外博主测得更细,意见也更分裂。

WorldofAI 在内测期间就发了完整视频,编程、3D 模拟、网页小游戏、智能体任务、看图,挨个过了一遍,给的评价是又快又省又好用。

可 MindStudio 汇总的几项实测,画风完全不一样。让它写代码画一幅图,59 秒搞定,花了不到 2 分钱,效率确实没话说,画出来的东西却明显比同台几个强模型差。让它做个魔方模拟,打开一看有模有样,能转能动,可一打乱就露了馅,色块会莫名其妙地变颜色;点"还原",它根本没去算怎么解,只是把打乱的步骤倒着放一遍,来回几次,魔方彻底乱套。再让它用画图软件临摹一张肖像,能认出画的是谁,但整张画是平的,没有强模型那种一层层叠上去的笔触。

MindStudio 对它的评价是,花架子,看着像样,里面的逻辑混乱。

独立评测机构给出的数字,和这个感觉差不多。

Artificial Analysis 的综合智能指数给了它 40 分,在同体量的开源模型里已经算很高了,输出速度实测每秒 214 token,也很突出。可就在同一张榜上,智谱的 GLM-5.3-Flash 拿了 42 分,压了它一头,跟最前沿的那几个闭源模型比,差距就更大了。Kingy AI 还做过一个小范围的对照,让它和 Qwen3.8-27B 做同一批编程、看图和工具调用任务,Qwen 8 次全过,DeepSeek 过了 7 次,胜在花钱少。

回过头再看,夸它的人盯着速度和价格,挑毛病的人盯着活到底干没干对,两拨人各说各的。

同样 Terminal-Bench,V4.1 Flash 在 2.1 版上是 90.6,换成更难的 3.0 版就只剩 30。同一个模型,测试版本一换,分数差出三倍,一个数字就能讲出两种故事。

编程跑分标准,大多是写出来的代码能不能通过一套现成的测试,可平时我们交给模型的活,很多压根没有标准答案,我们做一个真能用的小工具,理清一段绕来绕去的逻辑,要把一件事从头办到尾。

魔方模拟就是现成的例子,界面好看,分数也高,偏偏不能用。

我个人始终认为,能干活的模型才是好模型,跑分最高的未必是。

V4.1 Flash 的快和便宜都是真的,批量处理文本、写草稿、搭个简单网页、跑自动化流程,这种够用就行的活交给它,很可能是眼下最划算的选择。

要是打算让它扛那些逻辑要严丝合缝、一步都错不得的任务,先别看排行榜,拿自己手头的真实任务跑一遍再说。

开源了,本地跑得动吗?

前面提到的 Kingy AI 那次对照,他有一个观点我很认同,要论在普通电脑上跑本地模型,Qwen 更现实。

这句话,是本地AI应用者最关心的事情,开源了,我能不能直接在本地跑?

上一代 Flash 在这件事上其实做的不错,V4 Flash 总参数 284B,社区压缩之后一百来个 G,量化后,192G内存的机器就装得下,单台 AI Max+ 495的设备每秒也能出十几个 token。

到了 V4.1,参数翻了将近一倍,官方放出来的原版权重就有 480GiB 左右,想跑起来,基本得上一台 8 卡服务器。

Youtube上有人拿单台 DGX Spark 试过,128G 内存装不下,就把大部分权重留在固态硬盘上,用到哪块读哪块。模型跑起来了,可每秒还出不了 1 个 token,问一句话,等第一个字蹦出来要 74 秒,能处理的上下文也只开到 2048 个 token。

能跑吗,能,能用吗,不能。

目前本地部署最顺利的,是 Diffbot 在 Hugging Face 上放出的一套方案:把权重狠狠压缩到 2 比特左右,塞进两张 96G 显存的 RTX PRO 6000。单路生成每秒 113 个 token,4 路同时跑,加起来接近 280。

他们拿真实的编程智能体任务连续跑了 40 分钟,处理了 184 次请求,顺利完成,。但模型压得太狠,关掉思考模式后,简单任务看不出损失,复杂任务完全拉垮。

其实我们知道,本地 AI 最看重的不是算力,是显存,目前看,下周开始交付的 512GB 版 Mac Studio,量化之后或许装得下,我们等着看实测。

所以想把 V4.1 Flash 搬回家的,先掂量掂量手里的显存,别被"开源"两个字晃了眼,用 API 调它,一百万 token 才几块钱;自己部署,门槛是两张专业卡起,起码20万+。

其实不止DeepSeek一家,我们把今年国产开源模型放到一起,就会发现,现在的开源模型越做越大,端侧似乎被遗忘了。

DeepSeek 的 Flash,从上一代的 284B 涨到这一代的 552B;智谱之前的 GLM-4.7-Flash,还常被列进适合消费级显卡的推荐名单,到了 GLM-5.3-Flash,总参数已经是 320B。MiniMax M3 开源出来的权重约 428B,Kimi K3 比通义 2.4T 的旗舰还要大。

Flash 原本的意思是快、轻、便宜,现在只剩便宜。

可日常办公真正用得上的本地模型,恰恰是 20B 到 100B 这一档,写周报、改文档、总结会议纪要、查资料、写个小脚本,这些活用不着几百 B 的模型,要的是在自己电脑上跑得起来,数据不出门。

按现在的硬件,32G 内存的机器能跑三十多 B 的量化版,比如 Qwen3.8-27B 压缩后只有 20G 左右,今年厂商们卖得最卖力的 AI PC、统一内存小主机和桌面工作站,对应的正是这个区间。

而国外厂商在这一档并没有缺席,Google 的 Gemma 4 有 26B 的版本,OpenAI 的 gpt-oss 有 20B 和 120B 两个尺寸,英伟达也有自己的 Nemotron 系列。

国产头部厂商里,还在认真做这一档的,几乎只剩通义。Qwen3.8 这一代,旗舰做到了 2.4T,同时开源了一个 27B,用的还是最宽松的 Apache 协议,而且还足够聪明。

为什么大家都往大了做,原因我觉得也不难猜。

模型大才冲得上排行榜,才撑得起 API 生意,发布会上报出一个几百 B、上万亿的数字,声势也足。一个 30B 以内的小模型,很难上热搜。

另外,模型厂商也要赚钱,能在端侧用模型的偏C端用户,从来就不是这几个模型厂商的主力付费用户,端侧一旦跑起来,还会影响自家的API生意。大参数的模型开源,主要针对大型国央企等数据不能上云等公司,他们大多除了部署模型,还会为定制化付费。所以,开源大参数模型,名声有了,钱也赚了,何乐而不为。

至于端侧,谁让你穷呢….

最后,由衷的致敬阿里通义实验室!

至顶网至顶AI实验室频道