数据中心基础设施初创公司Clockwork Systems Inc.近日宣布完成3100万美元新一轮融资,该公司专注于帮助人工智能芯片集群提升运行效率。与此同时,公司还推出了一项名为TorchSnap的新功能,用于减少计算资源的浪费。

本轮融资由Seligman Ventures、Wing Ventures和Premji Invest共同领投,现有投资方New Enterprise Associates和e& Capital也参与跟投。至此,该公司累计融资总额已达7300万美元。

当前AI计算成本快速攀升,Clockwork表示,许多企业现在的关注点已不再是获取原始图形处理器资源,而是如何最大化利用现有集群的效能。在运行包含数千个GPU的大规模分布式AI工作负载时,硬件故障几乎每天都会发生。一个典型案例是Meta Platforms Inc.的经历:在其Llama 3模型长达54天、涉及16384个GPU集群的训练过程中,平均每三小时就会出现一次硬件问题。

面对此类故障,团队通常需要从保存的快照中重新加载进度,但这一恢复过程最长可能耗时90分钟。该初创公司指出,在这段时间里,数千个健康运行的GPU只能闲置等待,而一旦恢复运行,整个集群往往还要重复此前已经完成的计算工作。

正因如此,容错能力已成为数据中心运营商和AI团队面临的重大课题,而这正是Clockwork致力于解决的问题。该公司开发了一套可编程软件层,部署在GPU与正在运行的AI工作负载之间,能够同步GPU集群运行状态,并提供纳秒级精度的遥测数据,在故障引发整个集群重启之前就能及时识别问题。

Clockwork首席执行官苏雷什·瓦苏德万表示,尽管运行如此庞大的集群时GPU故障在所难免,但团队不应因此损失这些芯片已经完成的大量工作成果。"容错能力实际上是一种有效产出的倍增器:它能让GPU持续执行有用的工作,而不是被迫等待恢复或重复已完成的计算,"他说道。"我们与运营着一些规模最大的GPU集群的企业和云服务商共同开发了这套软件,因此它能够应对他们实际遇到的各类故障。"

随着TorchSnap新功能的推出,瓦苏德万表示Clockwork正在进一步增强集群弹性能力,在现有的LinkPass网络故障切换工具和TorchPass GPU迁移软件基础上,新增了第三层保护机制。这位首席执行官解释称,该功能的工作原理是对集群中每个节点上运行的分布式AI推理工作负载进行多节点快照捕获,无需开发者修改任何代码,从而使正在运行的任务能够迅速从中断处恢复运行。团队还可以在应用层添加"检查点逻辑",从而在故障发生后减少进度损失和计算重复。

SemiAnalysis分析师迪伦·帕特尔表示,AI推理工作负载迫切需要更强的容错能力。"集群容错过去只是训练环节的问题,但现在也成为了推理环节的问题,"他解释道。"Clockwork.io能够让副本在链路中断和网络故障期间持续提供服务,其极快的检查点技术加速了权重数据回传至运行集群的过程,使两个方向的运行都不会因此停滞。"

自一年多前完成上一轮融资以来,Clockwork的AI集群效率提升软件已在公共云基础设施提供商、新兴云服务商及企业级集群中获得快速应用。例如,微软公司旗下的LinkedIn已在其全部GPU集群中部署了Clockwork的LinkPass功能,每月可消除数千GPU工时的停机损失。LinkPass使其能够在发生硬件问题时,将AI流量绕开任何出现故障的光链路和交换机,从而保持任务持续运行。

另一家客户Together AI Inc.则以服务形式在其GPU集群上提供Clockwork的TorchPass功能。同时,面向企业出租GPU资源的新兴云服务商WhiteFiber Corp.也在利用Clockwork的技术,在新AI工作负载投入生产环境之前对集群可靠性进行审核和验证。

NEA风险投资合伙人格雷格·帕帕佐普洛斯表示,GPU最可靠的特性恰恰是其不可靠性。"只要把足够多的GPU装进一台机器,总会有一些出故障,但目前整个行业的应对方式依然是直接停止整个任务并重新加载检查点,"他说。"这种做法三十年前对超级计算机来说还算合理,但在如今这种规模下已经不再适用。我们早期就投资了这个团队,这次再次加码,是因为这一技术层正在成为AI集群不可或缺的组成部分。"

Q&A

Q1:Clockwork.io的TorchSnap功能主要解决什么问题?

A:TorchSnap能够捕获AI推理工作负载在集群各节点上的多节点快照,无需修改代码即可让中断的任务从断点处快速恢复,从而减少GPU故障导致的计算资源浪费。

Q2:GPU集群故障对AI训练有多大影响?

A:以Meta的Llama 3模型训练为例,在16384个GPU组成的集群中进行54天训练期间,平均每三小时就会出现一次硬件故障,恢复过程最长可能耗时90分钟,期间大量GPU被迫闲置。

Q3:目前有哪些企业已经使用Clockwork的技术?

A:微软旗下LinkedIn已在全部GPU集群部署LinkPass功能,Together AI以服务形式提供TorchPass功能,新兴云服务商WhiteFiber则用其技术审核集群可靠性。

SiliconANGLE