AI硬件的竞争,正在出现一个意外变化。

过去一年,想要运行大模型,往往意味着投入昂贵的GPU服务器。几十万元甚至上百万元的计算设备,成为企业部署AI的重要门槛。很多人认为,本地AI永远只能停留在“小模型试玩”阶段,真正强大的模型仍然属于云端超级计算中心。

但最近,Level1Techs做了一次实验:拿两台英伟达DGX Spark,挑战了一套搭载四张RTX Pro 6000的高端AI工作站,结果出乎预期。

虽然RTX Pro 6000系统在速度上依然占据优势,但在模型输出质量、代码生成能力以及复杂任务执行效果上,双DGX Spark已经接近这套价格高出数倍的专业设备。

双GB10硬刚四张RTX Pro 6000!本地AI正在逼近百万级算力服务器

两台DGX Spark,跑出了接近专业AI工作站的效果

为了验证这一点,他搭建了一套更加接近真实使用环境的测试。

测试一边是两台DGX Spark组成的小型AI集群。DGX Spark基于英伟达GB10平台,两台设备通过200Gbps QSFP高速连接协同工作,拥有256GB统一内存,可以运行较大规模模型。

另一边则是一套高性能AI工作站,搭载四张RTX Pro 6000 GPU。无论从GPU数量、显存容量还是整体价格来看,这套系统都属于专业级配置。

测试模型选择了DeepSeek 0731,并采用NVFP4量化格式运行。选择DeepSeek的原因在于,这类混合专家模型经过了高度优化,对量化精度更加敏感。如果低精度版本仍然能够保持接近原始模型的能力,就意味着更低成本硬件也有机会承担复杂AI任务。

最开始,博主并没有对DGX Spark抱有太高期待。他认为,这类设备可能适合研究和实验,但很难达到大型GPU系统的实际效果。

然而测试结果改变了他的判断。

在速度方面,RTX Pro 6000系统大约快7倍,但两者生成内容的质量差异非常有限。无论是逻辑测试、代码开发、代码审查,还是工具调用任务,双DGX Spark都表现出了接近专业系统的能力。

唯一明显的问题出现在一些简单的计数任务上,例如要求模型统计某个单词中字母数量。他发现,采用FP4量化后的DeepSeek模型在这类任务中更容易出错。

但除此之外,大多数测试结果都非常接近。

这说明,影响AI能力的不只是硬件规模,模型优化和推理软件同样重要。

从写代码到执行任务,Agent正在改变本地AI玩法

为了进一步验证两套系统的实际能力,他给模型安排了一项完整开发任务。

他准备了一份约2500字的需求文档,让AI开发一个增强版Breakout游戏,也就是经典打砖块游戏的升级版本。需求包括HTML和JavaScript实现、增加特殊玩法机制,并要求AI通过代码注释帮助学习者理解开发过程。

随后,两套系统分别完成任务。

最终结果并没有出现性能更强的GPU系统全面领先的情况。

两套模型都生成了可以运行的代码,但都存在一定问题。RTX Pro 6000系统生成的程序虽然完成度较高,但代码解释和注释部分表现一般,还出现了一些影响运行的问题。

相比之下,双DGX Spark生成的版本在代码说明方面更友好,更适合作为学习材料。

这个结果让他意识到,未来AI能力竞争并不会只看单纯的模型大小或者硬件数量。

真正影响用户体验的是一整套系统:

模型负责推理,量化技术负责降低资源需求,推理框架负责提升效率,而Agent工具则负责让模型完成更加复杂的任务。

在这次测试中,他使用了Turnstone这类Agent Harness,让模型能够拆解任务、调用工具、执行步骤并检查结果。

传统聊天机器人只能回答问题,而Agent系统可以围绕一个目标持续行动。

例如,让AI审查代码安全问题,它不仅需要理解代码,还需要读取文件、运行测试、分析结果,并根据反馈不断调整。

这种能力,正在成为本地AI设备真正的价值所在。

软件优化正在重新定义硬件性能

让他感到惊讶的另一个地方,是DGX Spark性能提升的速度。

设备刚推出时,很多人认为它最大的限制来自内存带宽。相比高端GPU,GB10平台在数据吞吐方面存在差距,因此很多人怀疑它是否适合运行大型模型。

但过去几个月,软件生态的快速优化改变了这一情况。

包括VLLM优化、CUDA Kernel调整、DeepSeek专用补丁以及NVFP4格式支持,都让同一套硬件获得了更高性能。

在优化后的环境中,双DGX Spark运行DeepSeek可以达到约60 tokens/s级别的速度,多任务并发时整体吞吐甚至超过200 tokens/s。

这意味着,本地AI硬件的发展逻辑正在变化。过去,硬件性能主要由芯片规格决定。现在,软件栈的重要性越来越高。同一块芯片,在不同模型、不同推理框架和不同优化方案下,可能呈现完全不同的实际能力。

至顶AI实验室洞见

博主最后把这种变化比作20世纪80年代个人电脑的发展。

早期个人电脑无法和大型计算机相比,但它改变了计算的分布方式,让更多人拥有自己的计算能力。

如今,本地AI也正在经历类似过程。普通用户可能仍然无法在家训练超大规模模型,但通过更成熟的开源模型、更高效的量化方案以及Agent工具,他们已经可以完成大量过去需要专业服务器才能完成的任务。

例如,自动调试代码、分析项目资料、执行测试流程、辅助学习新技术,甚至完成复杂的软件开发。

这次双DGX Spark与RTX Pro 6000的对比,展示的是一个趋势:随着模型不断优化,云端超级计算和本地设备之间的距离正在快速缩短。

未来,AI能力可能不会只存在于大型数据中心,越来越多智能计算能力会进入个人和小团队手中。

END
本文来自至顶AI实验室,一个专注于对AI计算机、工作站及各类AI相关硬件设备,开展基于真实使用场景评测的研究机构。

至顶网至顶AI实验室频道 作者:刘文轩