Cerebras Systems发布了CS-4,这是一款新型机架级AI系统,可在不使用网络交换机的情况下跨机架连接其晶圆级处理器。这一设计旨在随着AI基础设施日趋复杂,有效降低通信延迟。
与英伟达等AI加速器供应商竞争的Cerebras表示,CS-4的运行速度最高可达上一代CS-3的两倍。在使用GPT-OSS-120B模型的测试中,该公司称其每用户推理速度最高可达GPU系统的30倍,但实际吞吐量会因模型和服务配置而有所差异。
CS-4是基于Cerebras全新Nexus机架级架构的首款系统,内置Direct Wafer Links技术,可将晶圆间延迟降至最低2微秒。该系统还支持基于以太网的RoCE v2协议,能够与现有数据中心网络互联,每台CS-4可提供高达7.2 Tbps的系统I/O带宽。
取消交换机的潜在收益
Counterpoint Research研究副总裁尼尔·沙阿(Neil Shah)表示,取消Cerebras系统间的交换机,有望同时降低基础设施成本和能耗。"通过Direct Wafer Links将晶圆级芯片直接机架对机架连接,可以省去庞大复杂的网络硬件层,这部分硬件通常会消耗AI集群预算的很大一部分,以及多达三分之一的电力。"
然而,这一方案存在权衡:与传统交换网络相比,点对点连接在流量重路由和故障处理方面灵活性较低。
TechInsights半导体分析师马尼什·拉瓦特(Manish Rawat)指出,这种架构可以减少对Cerebras系统间传统交换层的依赖,但不会完全消除常规网络需求。"外部连接、存储、编排以及与异构计算的通信,仍然需要传统网络。"他认为,更大的考验在于该架构能否降低基础设施成本,并使生产部署更易扩展。
Fab Economics首席执行官丹尼什·法鲁基(Danish Faruqui)表示,数据摄取和集群管理仍将依赖传统以太网基础设施,而分离式推理中的外部系统将通过RoCE v2与CS-4通信。
开放性与封闭性的博弈
Cerebras在外部连接上采用了基于标准的方式,RoCE v2协议使CS-4可以接入现有高速以太网基础设施。拉瓦特认为,这也有助于CS-4与其他计算平台协同工作,尤其是在分离式推理部署场景中。
然而,Cerebras内部架构的取舍则截然不同。Direct Wafer Links是专有技术,第三方加速器无法接入该架构,扩展时只能增加Cerebras系统。
法鲁基指出,运营层面的割裂或许比物理网络挑战更为突出——现有编排环境通常围绕传统多加速器节点设计,而CS-4依赖Cerebras自有软件栈来管理其内部晶圆级架构上的工作负载,这可能导致企业需要在现有GPU基础设施之外单独维护一套管理域。
"关键的行业考验,在于客户是将这一架构视为更广泛AI基础设施中的开放组件,还是高度优化但相对封闭的技术栈。"拉瓦特说。
封闭性同样延伸至软件层面。Cerebras虽支持PyTorch等框架,但工作负载须通过公司自有的CSoft软件平台运行。沙阿表示,与英伟达CUDA生态相比,该软件生态在成熟度和广度上仍有差距,企业在评估Cerebras晶圆级方案的优势时,须将这一因素纳入考量。
推理加速引发的连锁压力
更快的推理速度可能给存储和数据摄取系统带来更大压力,以持续向加速器供应计算任务。
"挑战从Token生成速度,转变为输入Token和上下文数据的供给速度。"沙阿说。
法鲁基指出,一个压力节点可能出现在推理的预填充阶段——模型在生成Token之前需要处理输入提示。在分离式部署中,这项工作可能在CS-4之外完成,再通过以太网传输到Cerebras系统。在这种架构下,外部网络性能变得尤为关键,因为模型状态和上下文数据必须足够快速地传入CS-4,才能保持解码引擎持续运转。
功耗效率与散热挑战
Cerebras还将CS-4定位为高能效产品,宣称其每瓦吞吐量最高是CS-3的10倍。拉瓦特表示,随着AI计算密度提升,这一效率优势将有所帮助,但无法从根本上消除大规模部署下的供电和散热约束。在机架层面,法鲁基指出,晶圆级系统将计算资源高度集中在较小的物理空间内,可能对本地供电和液冷系统提出更高要求。
Q&A
Q1:Cerebras CS-4的无交换机架构有什么优势?
A:CS-4采用Direct Wafer Links技术,可直接在机架间连接晶圆级芯片,无需传统网络交换机。这样可以省去复杂的网络硬件层,降低AI集群的基础设施成本,并减少多达三分之一的电力消耗,同时将晶圆间延迟降至最低2微秒,显著提升通信效率。
Q2:CS-4的封闭架构对企业部署有什么影响?
A:CS-4的Direct Wafer Links是专有技术,第三方加速器无法接入,扩展时只能增加Cerebras设备。软件层面须通过CSoft平台运行,与英伟达CUDA生态相比成熟度不足。企业可能需要在现有GPU基础设施之外,单独维护一套CS-4管理域,增加运营复杂度。
Q3:CS-4的高推理速度会带来哪些新的瓶颈?
A:CS-4更快的推理速度会将压力从Token生成转移到数据供给环节,存储和数据摄取系统需要更快地向加速器输送数据。在分离式推理部署中,预填充阶段的工作在外部完成后需通过以太网传入CS-4,外部网络性能因此成为影响整体效率的关键因素。
