当前关于数据中心和GPU的讨论大多集中在企业能多快采购加速器来支持AI工作负载,以及能多快建成设施来部署这些硬件。然而在未来几年内,一个同样重要的问题将逐渐凸显:如今部署的GPU究竟能使用多久?当这些设备走到使用寿命尽头时,企业又该如何应对?

这些问题不仅关乎长期的容量规划,也与应对AI基础设施带来的电子垃圾挑战密切相关。而且情况相当复杂,因为“寿命”一词的含义会因评估角度不同而有所差异——是指硬件在物理上仍能运转,还是指硬件在经济上仍然值得继续运行。

物理寿命:数据中心GPU如何失效

一般来说,如果单纯从物理功能角度定义寿命,大多数GPU至少能运行五年,甚至可能更久。与服务器或PC内的多数组件一样,GPU并不会像机械系统那样简单地“磨损”。在板卡层面,GPU没有任何活动部件(数据中心GPU通常采用被动散热,风扇位于机箱内),因此在正常使用下不会自然老化。

尽管如此,故障仍会发生,通常源于外部或板级因素:

热应力与散热不足。持续的高温和热循环会加速焊点疲劳,并可能损害高带宽内存(HBM)和显存(VRAM)。

电源质量与瞬变问题。电力输送长期不稳定或电压浪涌都可能损坏GPU。这类问题可能源自设施电力异常,但机架和服务器层面的故障(如电源单元失效)同样可能是元凶。

环境因素。如果过滤和监测措施不到位,灰尘、湿度和污染物都会增加故障风险。

在实际应用中,凭借良好的散热系统、稳定的电力供应和有效的监测手段,许多运营商能实现多年的服务寿命,不过实际表现会因工作负载强度、使用周期和环境条件而异。即便硬件仍能正常运转,保修和支持期限(通常为三年,OEM/ODM厂商可提供延长服务)往往会成为实际使用的上限。

经济寿命:何时更换才划算

从经济角度衡量,GPU的寿命通常更短。企业若想实现投资回报最大化,就需要判断在多长时间内继续使用现有设备,以及何时更换为性能更强的新一代产品才更划算。

这一决策需要综合考量多个因素:

企业在现有GPU上已经投入的资本;

新一代硬件的价格;

淘汰设备可能带来的转售收益;

现有GPU与新款GPU之间的性能差距;

依赖GPU的工作负载对性能的实际需求;以及

整个设备集群的实际利用率。

总体而言,当利用率较高、工作负载需求持续上升,且新硬件带来的性能提升超过增量成本时,更换设备在经济上就是合理的。

基于这一逻辑,参考近期的产品迭代周期,尤其是英伟达的更新节奏,GPU的平均经济寿命大约在两到四年之间。2022年推出的Hopper系列GPU,性能大约比2024年推出的Blackwell系列低2.5倍,而据称Blackwell芯片能将AI推理成本降低多达10倍。由于两代产品的价格区间相近,几年前投资了Hopper的企业,若能获得供应保障,完全有理由考虑升级到Blackwell GPU。

GPU达到使用寿命终点后该怎么办?

如果GPU在经济上已不再值得继续运行,直接丢弃是一种双输的选择——不仅损失了残余价值,还制造了不必要的电子垃圾。

由于大多数设备在物理上仍然完好,更好的做法是将其转售。GPU二手市场目前正蓬勃发展。即便转售价格只有原价的10%到20%,这个结果也比支付处置费用要划算得多,同时还能回收一部分资金用于再投资。

转售退役GPU可回收原始成本的10%至20%,既能减少电子垃圾,又能为下一代升级提供资金支持。

自购与租用:GPU即服务模式

最后值得一提的是,对于不愿承受短经济寿命压力的企业而言,还有一种战略性替代方案:采用GPU即服务(GPUaaS)模式。随着GPUaaS服务和新兴云服务商的兴起,企业有了租用算力而非自购硬件的选择,从而可以推迟甚至避免更换设备的决策。对于许多非超大规模企业而言,租用算力或许是应对不断变化的性能需求、同时避免资本被快速过时设备套牢的更务实之选。

Q&A

Q1:数据中心GPU的物理寿命一般是多久?

A:以物理功能是否正常运转为标准,大多数GPU至少能使用五年,甚至更久。GPU本身没有活动部件,正常使用下不会自然磨损,但热应力、电源问题和环境因素仍可能导致故障。

Q2:GPU的经济寿命和物理寿命有什么区别?

A:物理寿命指硬件还能不能正常运转,经济寿命则指继续使用是否还划算。参考英伟达近几代产品的更新节奏,GPU的经济寿命通常在两到四年左右,之后升级到新一代硬件往往更具性价比。

Q3:企业退役的GPU应该如何处理?

A:直接丢弃会浪费残余价值并制造电子垃圾,更好的做法是转售到二手市场。即便转售价格只有原价的10%到20%,也能回收部分资金用于再投资,同时减少电子垃圾。

DataCenterKnowledge