在本周之前,关于英伟达的主流叙事大致如此:在AI热潮兴起的最初几年,英伟达是顶尖GPU的唯一来源,随着行业规模不断扩张,这一地位为其带来了丰厚利润。而在过去几年里,亚马逊、谷歌等超大规模云服务商开始自研芯片,英伟达不再是市场上的唯一选择,这让许多投资者开始质疑其竞争优势究竟能维持多久。

这一叙事颇具说服力,也基本符合事实。从2023年初到2025年中,英伟达市值增长了约10倍,但过去一年间,受GPU竞争加剧的担忧影响,其股价走势趋于平稳。

然而,自本周三英伟达发布财报以来,一种新的市场叙事正在形成——投资者开始意识到,英伟达的优势远不止于GPU本身。随着AI算力需求攀升至吉瓦级别,算力调度正变得日益复杂。英伟达适时构建了处理这一问题所需的大量前沿硬件,使其在GPU本身竞争加剧的同时,仍在围绕GPU的整套系统层面保持巨大领先优势。

尽管外界不断谈论算力商品化,但要让大规模数据中心以峰值效率稳定运行,依然极具挑战——而随着部署规模越来越大、速度越来越快,这一挑战只会持续升级。

从英伟达实际销售的产品细节中,可以窥见这一趋势。该公司目前正在推出Vera Rubin架构,这一架构将Rubin GPU与多种其他单元相结合,包括Vera CPU、Groq 3 LPX推理加速器,以及专为存储和网络设计的同类机架。

过去一周,笔者与英伟达相关人士进行了深入交流,了解这些系统的实际功能,结果颇出乎意料。与Rubin GPU一样,这些都是高度专用化的系统,只不过它们的任务不是处理Token,而是确保GPU之外的一切组件尽可能高效运转。如果说GPU是发动机,那么这些系统就是汽车的其余部分。

其中,Vera CPU尤为关注数据调度问题。英伟达存储技术副总裁杰森·哈迪表示:"Vera之所以重要,是因为单台服务器或任何计算平台能够搭载的内存容量是有限的。"

随着数据中心计算能力的持续扩张,内存容量也在同步提升,这也是美光等公司在基础设施建设第二波浪潮中大获其利的原因所在。然而,如何在恰当的时机将数据送达GPU,并非一件轻而易举的事——当企业力图不断压低每瓦Token数量时,他们越来越意识到这种数据流量调度的重要性。

哈迪说:"在相关操作中,我们看到了高达3倍的性能提升,这正是Vera CPU发挥加速作用的体现。这样一来,我们就能充分释放闪存的潜力,在不造成瓶颈的情况下获取全部性能。"

类似的问题也出现在英伟达之外的其他公司。OpenAI在研发其Jalapeno芯片时,重要目标之一正是从设计源头规避这类挑战——尽量减少需要移动的数据量。

OpenAI本月初在一篇博文中表示:"我们在设计Jalapeno时,着重最小化数据移动和通信延迟。其宽阔的域架构使整个工作负载得以在一个互联系统内完成,从而减少数据搬运,帮助整个请求从头到尾保持高速、高效。"

这是一种截然不同的思路——通过在单一集成芯片内完成工作负载,从根本上避免数据移动。但其背后的逻辑与英伟达如出一辙:以更智能的流量控制取代单纯堆叠处理器周期,从而提升整体效率。这也为各大公司开辟了全新的基础设施竞争维度。

这场数据调度领域的新竞争,并不意味着英伟达可以高枕无忧。它将面临来自其他芯片制造商和超大规模云服务商的挑战,正如当年在GPU领域所遭遇的那样。但竞争的战场已经转移——谁能让整套系统高效运转,比单纯打造一款竞品GPU更为关键。

而就目前的早期阶段而言,英伟达看起来仍然保持着压倒性的领先地位。

Q&A

Q1:英伟达的Vera CPU是做什么的?

A:Vera CPU主要负责数据调度与流量管理。在大规模数据中心中,如何在恰当时机将数据送达GPU是一大难题。Vera CPU通过加速相关操作,可实现最高3倍的性能提升,能够充分释放闪存潜力,避免数据传输瓶颈,从而提升整体计算效率,帮助数据中心在更低能耗下处理更多Token。

Q2:英伟达的Vera Rubin架构包含哪些组件?

A:Vera Rubin架构是英伟达目前正在推出的新一代平台,由多个高度专用化的硬件单元组成,包括:Rubin GPU(负责核心算力)、Vera CPU(负责数据调度与编排)、Groq 3 LPX推理加速器,以及专为存储和网络设计的同类机架。这些组件共同协作,目标是让整套系统在GPU之外也能高效运转。

Q3:OpenAI的Jalapeno芯片和英伟达的方案有什么区别?

A:两者解决的是同一类问题——如何减少数据移动带来的性能损耗,但路径不同。英伟达通过Vera CPU对数据流量进行智能调度;而OpenAI的Jalapeno则采用大域架构设计,让整个工作负载在一个集成芯片内完成,从根本上避免跨系统的数据搬运,以此降低通信延迟、提升端到端效率。

TechCrunch - AI