热情无法驱动AI工作负载,基础设施才能。随着越来越多组织采用AI,现有设施的局限性正在显现:电力不足、散热能力欠缺、运维复杂性增加,以及新的安全风险。如果这些需求得不到解决,AI项目将停滞不前、难以扩展,甚至可能让敏感数据面临风险。
AI能够推动增长和长期竞争力,但前提是领导者要诚实评估现有准备情况,结合投资策略和未来需求规划。一旦判断失误,这不仅是小挫折,而是关乎AI投资能否成功落地的关键差异。在投入预算之前,可以通过以下五个步骤找出需要改进的基础设施环节。
打好正确的基础
AI性能依赖于其背后的基础设施。服务器、存储和网络必须能够处理高计算密度和大量数据流,而不会出现过热或故障。即便是能力出众的AI系统,如果基础要素跟不上,表现也会大打折扣。
以生产线上的质量检测场景为例。摄像头、存储和计算资源必须与传送带速度相匹配,以实现实时推理。如果整个流程跟不上节奏,有缺陷的产品就会被漏检。同样的原理也适用于数据中心内部:即便是更快的GPU集群,也可能被存储吞吐量、网络拥堵或散热限制所制约。
这要求企业从系统协同运作的角度进行评估,而不是孤立地看待各个组成部分。
优先考虑电力和散热能力
要判断企业的技术基础设施能否支撑AI工作负载所需的高强度运算,必须仔细审查电力容量和散热基础设施。为5千瓦设计的机架无法支撑20千瓦的AI节点。如果电力供应不足,AI部署可能在启动之前就陷入停滞。
稳定的电力供应与容量同样重要,企业必须评估当前环境能够持续提供多少电力,以及散热系统能否应对额外产生的热量。电力供应和散热能力必须同步扩展,才能支持持续的AI处理。任何一方出现短板,都会削弱整个系统的运行效果。
在整个AI环境中建立安全保障
AI应用程序通常会处理敏感和专有数据。保护这些资产需要多层次的安全措施,包括物理安全、网络防御和访问控制。任何一层出现漏洞,都会使其他层面暴露于风险之中。
企业还应评估AI特有的风险,包括模型操纵和数据泄露,以及所属行业的监管和政策要求。全面的方法既能保护底层基础设施,也能保护其支撑的AI环境,将安全视为基础要素,而非附加功能。
在成本的可预测性与灵活性之间做出选择
不同的组织对成本可预测性的重视程度各不相同。有些组织需要稳定、可预测的支出来管理预算,而另一些组织则更看重灵活性,能够接受一定程度的波动。这两种方式都没有对错之分,选择取决于组织的基础设施策略和财务优先事项,而这些因素又决定了应如何安排AI支出。
云计算定价的变化可能会带来不确定性。应尽早让财务和工程团队保持一致,以避免出现错配——需要预算确定性的组织不应被可变账单打乱计划,而重视灵活性的组织也不应为不需要的保障支付过高成本。
从一开始就实现这种协调,意味着AI支出决策能够支持更广泛的财务战略,而不是与之背道而驰。随着AI应用的增长,FinOps原则有助于设定防护边界,同时为创新保留空间。
预留增长空间
AI工作负载很少保持静态。随着组织扩展现有应用、引入新的使用场景,或因整体业务增长带来使用量增加,需求也会随之增长。为当下工作负载构建的基础设施,很快可能成为明天的制约因素。
这要求企业不仅要提升处理能力和存储容量,还要同步扩展支撑它们的网络和散热系统。可扩展性应从设计之初就融入基础设施规划。具备这种灵活性,组织才能随着AI需求的演变做出相应调整。
从准备到成果
AI投资的成败,取决于基础设施能否从初始部署到未来增长的全过程中提供支持。IT领导者可以借助这个五步框架,识别当前环境的不足之处,并优先推进支持AI计划所需的改进。在做出下一次AI采购决策之前,评估准备情况并弥补差距——否则就可能成为项目无法落地的原因。
Q&A
Q1:企业评估AI基础设施准备情况应该从哪些方面入手?
A:主要应从五个方面评估:基础设施协同能力、电力和散热容量、安全防护体系、成本可预测性与灵活性的选择,以及未来扩展空间的预留。
Q2:为什么电力和散热对AI基础设施如此重要?
A:AI工作负载对计算密度要求很高,为低功率设计的机架无法支撑高功率AI节点的运行。电力供应和散热系统必须同步扩展,否则任何一方的短板都会削弱整个系统性能,甚至导致AI项目在启动前就陷入停滞。
Q3:企业在AI支出上应该选择固定成本还是灵活成本模式?
A:这取决于企业自身的财务优先事项和基础设施策略,没有绝对的对错。需要预算确定性的企业应避免可变账单带来的意外支出,而重视灵活性的企业也不应为不必要的保障支付过高成本,关键是让财务和工程团队尽早达成一致。
