首页/至顶AI实验室/ Qwen3.8-Max的一次小考, 十二个真实任务,AI喜欢它,人不喜欢 原创 Qwen3.8-Max 跑完 12 个真实前端任务,出现了一个很有意思的现象:AI 评委平均打出 69.2 分,人工盲评只有 56.1 分,相差整整 13 分。问题不只是“模型强不强”,而是机器眼里的“写得对”,和人真正用起来的“好不好用”,可能根本不是一回事 Z ZDTL2026-08-19 · 阅读约7分钟 ↗ 分享 前两周,阿里发布Qwen3.8-Max。 2.4万亿参数的MoE 模型,每次激活95B,百万上下文,数据很好,Terminal-Bench 2.1 拿到86.6,PaperBench 93.0,OSWorld-Verified 86.1。 阿里给这次发布起的标题是"编程与协作的新标杆"。 当天,全网都是"国产模型再下一城"。 每一次模型发布,随附的都是这样一张表,一批通用基准,一组分数,和几个竞品并排,让大家一目了然地知道哪家模型能力更强。 题目就那么固定的一批,模型训来训去,得分越来越高,但做题做得好,跟真实环境中的好用,貌似根本不是一回事。 于是,现在通用AI 基准的分数基本就成了宣传的需要,真实环境的能力,还得重新测,尤其是在企业应用场景下。 前几天,来自旧金山的Startrise,就对Qwen3.8-Max 进行了一轮真实应用场景下的测试,结果有惊有喜。 Startrise 是旧金山一家做AI 落地的工作室,主要帮客户把AI 应用真正用起来。他们之所以自己搞评测,是因为给客户做方案的时候选错模型是要赔钱的。所以他们定了一套自己的标准,每有新模型出来就跑一遍,结果连同每一份交付物全部公开,迄今为止已经跑过主流的十五个模型。 12个真实任务 这次针对Qwen3.8-Max 的评测全部基于前端开发场景,十二道题,全是前端交付物。 一个滚动驱动的Three.js 页面、一个全屏WebGL 着色器、一个品牌落地页、一个能玩的3D 游戏、一道完全开放的创意题、一个模型给自己做的自荐页、一个符合WCAG 2.2 AA 的电影选座界面、一次按三张工单改存量项目、一套十八个手绘感SVG 图标、一个带校验和撤销重做的状态应用、一个完全不用JavaScript 的可交互页面、一封表格布局的HTML 邮件。 标准是单次生成,不许返工,不许追问,交付物必须是一个自包含的HTML 文件。 完成的交付内容先在浏览器里真的打开跑一遍,看它渲不渲染、报不报错、点下去有没有反应;然后交给三个AI 评委盲评,Claude Opus 5 看审美,GPT-5.6 Terra 看工程,Grok 4.5 看有没有照着题目做;最后是一位人工盲评复核。 三部分最终得分比例,按25% 技术、45% AI 评委、30% 人工。 最终结果,十二个真实任务,一件件看。 先看得分最高的一档。 品牌落地页87.3 分,其中在浏览器里全部功能均完全实现,技术侧满分;三个AI 评委也给出了85的高分。 这是这道题有史以来最高的得分,此前的纪录是Claude Opus 5 的85.8分。 全屏WebGL 着色器84.6 分,零BUG。 十八个手绘感SVG 图标81.6 分,同样是全部实现、技术侧满分、零BUG,同样也刷新了这道题的纪录,原来的保持者是Claude Fable 5。 三个任务,两项破纪录,这一档是Qwen3.8-MAX碾压性胜利。 无障碍选座界面81.3 分,也在上半区,这一次出了点岔子,虽然技术侧整体给到83.7,但其中专门测交互的那一项,还是出现了BUG;三个AI 评委扒开源码看完,给了80,而且是全场分歧最小的一道,三个AI之间只差0.5 分。 同一份东西,人说它点不动,AI说它写得很好,也确实够魔幻。 中间一档没什么戏剧性,自荐页77.8,不用JavaScript 的可交互页面77.6,按三张工单改存量项目76.4,完全开放的创意题75.4,表格布局的HTML 邮件73.4。都交付了,都勉强能用,但也都不出彩。 自荐页那道有个共同现象值得提一句,最近新发布的三个新模型Qwen3.8,Grok4.6,Muse Spark 1.2,在"自己身份"这一项上全部不及格,只拿了50 分。让模型介绍自己,谁都介绍不明白。 剩下的几个任务,Qwen3.8-MAX 就开始拉了。 带校验和撤销重做的应用62.8 分,8 个BUG。这道题是十二道里最接近日常真业务的一道,一个表单,要能校验,要能撤销重做,Qwen3.8-MAX完全没有完成。 3D游戏47.7 分。这一道和无障碍那道正好反过来:在浏览器里一秒跑120 帧,交互全通,技术侧给到85.7;AI 评委却看出循环是坏的,找出了7个致命BUG;人工评审复核后,认为BUG全部存在,最后只给了20 分。 得分最低的是滚动驱动的Three.js 页面,29.3 分。控制台报错,页面几乎不渲染,没有动画循环,滚动近乎失效。技术侧58.6,AI 评委32.5 并且找出了9个致命BUG,人工评审复核后直接给了0 分。 单次生成没有第二轮,一个没接住的异常,六十分就没了。这道题此前也放倒过Claude Fable 5,只拿到22.5,是个公认的硬骨头。 十二件真实任务全部交付,没有违反格式约定,没有截断,只有两道在浏览器里跑出了报错。但从87.3 到29.3,跨度接近六十分。 最终Qwen3.8-max综合得分71.3,十五个模型里排第六。 尤其是跟自己的上一代比进步很明显,Qwen 3.7 Max 总分63.6,排第十二,十二道题一个前三都没进过,3.8 这一代进了五个。 我觉得比总分更值得关注的是那六十分的跨度落在哪儿。 上半区四件——落地页、着色器、图标、选座界面,共同点是“看起来对不对”。 下半区三件——状态应用、3D 游戏、Three.js 滚动,共同点是"跑起来对不对"。 我发现,越是靠视觉呈现的活,Qwen 干得越好;越是要维持状态、要接住异常、要在时间里持续正确的任务,模型干的比较差。 同样的规律也出现在打分复核的人身上。 三个AI 评委平均给Qwen 打了69.2分,而完全盲评的人工评审给了56.1。差了十三分。如果说人工评分就是低于AI也不对,同期跑同一套题的Grok 4.6,评委67.1、人工65.0,两边只差两分,所以,这个十三分的差距不是常态。 分项中位数其实咬得很紧,做工、技术、原创性都是7、8、7 这个水平。机器和人的分歧不在单项打分上,在最后那一眼。 最后,还是要看一下花费,跑完这十二个任务,Qwen 输出了47.7 万token,用时12107 秒,全场倒数第二慢,倒数第一是Kimi K3;最终花掉2.92 美元。 值得提一下的是,其他同标准价位的模型跑完同一套题,通常在一美元多一点。 这个数据也告诉我们,不要只看标价便宜,真实任务,跑一遍才知道要花多少钱。 能干活的模型才是好模型 15个主流模型中排名第六,Qwen3.8-max的成绩其实还不错,而且这也只是Startrise基于自己的一个前端开发场景。 相比纠结这个评测是不是片面,我更关注评测过程中,AI评委和人差的那十三分。 AI评委读的是源码,源码写得规不规范、结构对不对,它比人看得准,也比人快。人拿到的是页面,打开、点一下、划一下,页面自己会说话。一份写得工整但跑不起来的东西,前者容易给高分,后者不会。 所以那十三分不是谁看走了眼,是两边的关注点不同。 现在满世界的排行榜,评委席上坐的越来越多的开始是AI,它们读代码、看结构、判断这个做得对不对,判断得快,判断得便宜,还前后一致。看似非常合理,省心省力。 但最后用这个东西的是人,人不看代码,人看的是页面打开那一瞬间好不好看、点下去有没有反应、划一下会不会卡。就像Qwen这次,同一批交付物,两边给出相差十三分的判断,这条差距其实就是榜单和真实使用之间的距离。 所以榜单适合用来划范围,不适合用来做决定。真正该做的,是把适合自己业务场景的任务固定下来,让候选模型各做一遍,从用户角度出发,自己看。这比任何的成绩单都实在。 END 本文来自至顶AI实验室,一个专注于对AI计算机、工作站及各类AI相关硬件设备,开展基于真实使用场景评测的研究机构。 至顶网至顶AI实验室频道 作者:ZDTL 阿里Qwen3.8-Max大模型