本周,当科技巨头们在旧金山Salesforce公司举办的Dreamforce大会上就是否应该放缓人工智能部署速度展开激烈辩论时,一群实力雄厚的科技专家正在约一小时车程外的圣克拉拉召开会议,讨论他们如何以最快速度构建AI基础设施。
在AI Infra Summit大会上,来自亚马逊云科技、甲骨文、博通、高通和d-Matrix等公司的技术专家们,阐述了他们如何努力优化基础设施,以满足AI不断增长的需求。围绕这项技术的挑战正日益清晰:AI耗电巨大,对内存的需求也极为旺盛,而Token成本目前正在许多企业中失控攀升。
高通数据中心和AI部门执行副总裁兼总经理托尼·皮亚利斯在周三的会议演讲中表示:"每瓦特Token数已成为这场AI战争中的新关键指标。我们显然不能继续这种趋势下去,基础设施领域需要做得更好。"
面向推理需求的基础设施建设
短时间内,AI需求的指数级增长催生了多样化的算力形态。尽管2025年大部分时间里,训练AI模型都需要大量图形处理器算力,但今年对推理的关注导致Token使用量激增,也需要一种将中央处理器纳入其中的更加异构化的基础设施。
对于多年来一直自主研发CPU产品线的行业超大规模云服务商亚马逊云科技公司而言,这正是塑造未来AI基础设施的绝佳机会。亚马逊高级副总裁彼得·德桑蒂斯表示:"大部分算力都将用于服务推理,推理将成为一项巨大的工作负载。"
亚马逊云科技战略的核心是Graviton,这是该公司开发的一系列64位Arm架构CPU,旨在为云端应用提供能效优势。今年6月,亚马逊云科技推出了Graviton5 CPU,以支持实时AI推理和多步骤任务编排。
德桑蒂斯表示:"如今,亚马逊云科技上绝大多数工作负载在Graviton上运行更具成本效益,速度也更快。"他还指出,AI有望释放出更多软件专业化能力:"我认为由此将涌现出一大批通用型工作负载。"
突破内存墙
除了GPU与CPU之间的平衡博弈外,内存在AI处理中的作用也日益关键。据SiliconANGLE分析师的记录,一台典型的AI服务器所使用的内存量大约是传统服务器的八倍,AI服务器内存支出预计将从2025年的350亿美元跃升至2027年的1750亿至1900亿美元,增幅约达五倍。
这种加速增长导致业界在满足AI巨大内存需求的最佳解决方案上出现分歧。过去一年里,高通已将重心从传统的高带宽内存(HBM)转向一种名为高带宽计算(HBC)的新型专有架构。
高通公司估计,在大批量场景下,其HBC相比HBM每瓦特带宽提升六倍,相比静态随机存取存储器(SRAM)方案每瓦特容量提升200倍。据高通的皮亚利斯介绍,该公司认为HBC是克服内存墙问题的一种方式——所谓内存墙,即算力已超越内存容量和带宽的瓶颈状态。
他表示:"瓶颈在于数据搬运,而非算术运算本身。解决之道是让计算更接近内存。我们实际上已经把数据搬到了与计算同一栋'公寓'里,大家现在共用同一部电梯上下。HBC带来了业界所需的优势。"
与英伟达合作的Raptor DRAM方案
企业科技界还有另一个阵营一直在探索不同的内存墙解决方案,即依靠动态随机存取存储器(DRAM)。计算初创公司d-Matrix已将吞吐量更高的3D DRAM集成到其下一代芯片架构Raptor中。该方案将多层存储单元垂直堆叠,从而实现更高的存储密度和更优的性能。
d-Matrix创始人兼首席执行官希德·谢思在AI Infra Summit的演讲中解释道:"我们比SRAM强得多,实际上也比HBM表现更好。长久以来,我们一直在为一个'无限推理'的世界做准备。"
上周,谢思所在公司宣布与英伟达公司展开合作,将Raptor纳入这家AI芯片巨头的机架参考架构NVLink Fusion中。该方案旨在为AI实验室、超大规模云服务商和新兴云服务商提供部署超低延迟、高端Token服务的能力。
谢思表示:"我们决定直接搭乘这套基础设施的便车,通过这种方式,我们可以从Vera Rubin机架升级到Vera Raptor机架。"
面向可扩展性的网络架构
在将数以百万计的GPU、CPU、存储系统、内存和软件整合成一台高效运转的机器的过程中,网络已成为AI基础设施故事的核心部分。
网络正日益成为企业AI在性能、可扩展性和成本方面取得成功的关键要素。甲骨文公司的Acceleron便是这一网络聚焦趋势的一个例子,它是一种专为甲骨文云打造的高性能网络虚拟化架构,并融合了智能网卡技术。
甲骨文与英伟达及超威半导体公司(AMD)的合作,催生出一项名为Acceleron RoCE的网络技术,该技术提升了性能,并绕过了托管GPU的服务器中央处理器进行数据路由的环节。
甲骨文云基础设施高级副总裁卡兰·巴塔表示:"我们确实需要优化技术栈的每一个环节,网络正变得与算力本身同等重要。"
博通公司在塑造支持AI部署的网络技术方面也发挥了重要影响力。颇具历史意味的是,该公司围绕以太网这一诞生于20世纪70年代的技术,构建了其面向AI的网络架构。
以太网以高速率和低延迟著称。博通通过在AI集群中利用以太网结构,打造了其面向AI的网络产品组合。
博通去年推出的Tomahawk 6网络芯片,经过优化用于为数据中心的以太网交换机提供动力。Tomahawk 6借助一套名为"认知路由2.0"的AI功能来优化网络速度,该功能可通过检测网络拥塞并将数据重新路由至其他连接,从而避免性能瓶颈。
博通产品副总裁哈桑·西拉杰表示:"业界已达成一致共识,全球最大规模的集群都在使用以太网进行横向扩展。网络就是计算机。"
正如本周在硅谷举行的AI Infra Summit大会上的多场演讲所展示的那样,大量工作正投入到AI基础设施的建设中。原因其实很简单:AI如今已在企业中落地部署,客户需要让它变得更好。
在一场小组讨论环节中,几位发言者一边提及因Token支出而产生的巨额账单,一边又轻描淡写地表示这点成本无关紧要。
开利环球公司首席数据与AI官阿伦·南迪表示,该公司今年的Token支出增长了八倍:"我们实际上就是放开了让它运转。这是探索阶段的成本。对我们来说,重点不在于每个Token的成本,而在于每项任务所创造的价值。"
Q&A
Q1:什么是内存墙问题?为什么它对AI这么重要?
A:内存墙是指计算能力已经超越了内存容量和带宽的瓶颈状态。由于AI服务器需要处理海量数据,内存的读写速度和容量成为制约AI性能提升的关键因素,业界正通过HBC、3D DRAM等新方案来突破这一瓶颈。
Q2:Token per watt(每瓦特Token数)是什么意思?
A:这是衡量AI基础设施能效的新关键指标,指的是每消耗一瓦特电力能够处理的Token数量。由于AI耗电量巨大且Token成本持续攀升,业界认为提高这一指标是解决AI能耗和成本问题的核心方向。
Q3:为什么网络架构对AI基础设施这么重要?
A:AI需要将数百万个GPU、CPU、存储和内存整合成一个高效系统,网络在其中承担数据传输和协同调度的关键作用。像甲骨文的Acceleron和博通基于以太网打造的Tomahawk 6芯片,都是为了提升AI集群的性能、可扩展性并降低成本。
