数据中心运营商正在竞相扩展AI工作负载的基础设施容量,与此同时,他们也在越来越多地将AI引入自身设施的运营管理中。从冷却与电力优化,到预测性维护和故障响应,AI正在加速从试点走向大规模部署。

尽管完全自主运营目前仍属少数,但AI已在能耗、系统正常运行时间和运营效率方面带来了可量化的提升。超大规模云服务商和大型主机托管服务商凭借自研工具走在前列,中型运营商正在开展针对性试点,而许多规模较小的运营环境仍处于观望阶段。本文将重点介绍Digital Realty、AWS、DPR Construction和施耐德电气当前的AI应用实践及未来发展方向。

AI在数据中心的当前应用

分析师指出,运营商目前仍处于早期阶段。现阶段的部署主要集中在:通过数据分析提前预测故障、优化冷却与电力使用、提升IT资源利用率,以及为技术人员提供更有效的故障排查信息。部分情况下,AI可自主解决问题,但人工决策仍是主导。

"AI目前被用于离散化的模块,处理各类局部工作,"Omdia IT运营首席分析师Roy Illsley表示。

他表示,运营商希望最终能够实时优化整个数据中心的运行,但这一目标尚未实现。"未来,大量具体任务将由AI智能体承担,而人类则负责将这些任务串联起来并对决策进行监督。"

超大规模云服务商和大型主机托管服务商目前走在最前面,通常会自研工具。部分中型运营商在承受运营压力时开始试水,而大多数企业和小型数据中心尚未采用AI。

Digital Realty:OPDaaS平台、冷却优化与实测节能成果

Digital Realty已将机器学习应用于其设施运营超过五年,并在生成式AI兴起后迅速跟进,首席技术官Chris Sharp表示,该公司目前在全球运营300余个数据中心,服务对象涵盖超大规模云服务商到企业客户。

公司自研的"运营数据即服务"(OPDaaS)平台集成了一套AI工具,能够以亚秒级频率从供电、冷却及其他楼宇系统中采集遥测数据,并汇入中央数据存储。该平台通过API开放数据,供Digital Realty自有工具和客户工具进行分析,从而调节电力和冷却系统,提升效率并支持预测性维护。

例如,AI可检测风冷系统滤网是否堵塞——滤网堵塞会导致风机在无必要的情况下持续满负荷运转。通过主动清洗或更换滤网,效率可提升达两位数百分比。

Digital Realty还在北弗吉尼亚州IAD51数据中心引入了Phaidra的AI平台,英伟达是该数据中心的客户之一。该工具提供对二级液冷回路的可视化管控,使冷却系统能够按实际计算需求动态调节,而非始终维持满负荷状态。

目前,OPDaaS已在逾10个数据中心完成部署,计划于2026年底前扩展至30余个。据该公司2025年影响力报告,Digital Realty在数据中心规模扩展34%的同时,用水量仅增加3%,Sharp将此成果部分归功于OPDaaS和AI驱动的优化。"这一巨大的差距,若没有生成式AI持续监控泵、滤网和整套基础设施,是不可能实现的。"他补充道,公司2025年已节省17,800兆瓦时的电力。

目前,运营决策仍由人类根据AI发现作出,但Sharp预计这一模式将逐步演变,公司将允许部分决策以更自主的方式执行,尤其是在时间敏感的场景下。Digital Realty目前在网络运营中心设有专职团队实时监控系统。

"你会逐渐看到一些决策在人类监督下自动执行,这将是我们迈向自主运营的第一步,"Sharp说,"但我确实认为,未来由于基础设施的高度复杂性,必须允许大量决策以更算法化、更自主的方式来完成。"

AWS:面向网络运营的AI智能体与闲置电力优化

AWS正在利用生成式AI驱动的软件优化机架中服务器的部署位置,以减少"闲置电力"——即已分配却未被利用的能源。与此同时,AWS还在其网络运营中大规模采用AI与智能体工作流程,用于大规模基础设施管理。

AWS表示,其网络高度自动化,但在自动化无法判断正确操作时,系统会上报工程师。引入AI智能体的目标,正是让其自动完成跨数据源的调查、收集与关联分析。

AWS网络可观测性与自动化总监Zak Islam表示,在故障响应方面,AI智能体能够自动调查网络问题,通过关联多个监控系统的遥测数据,在数秒内定位根本原因,而非像过去那样需要数分钟,从而大幅缩短客户故障诊断时间。

针对服务、计算基础设施和网络中的日常运营问题,AI可自动审查传入工单,与历史模式进行比对,并在许多情况下无需人工干预即可解决问题,让工程师得以专注于更复杂或新型的问题。

AWS还使用AI监控光纤基础设施,并在检测到问题后自动联系供应商加快修复进度。在网络建设期间,AI还负责标记配置错误并将其路由至相关团队;工程师也越来越多地使用自然语言查询网络遥测数据,而非手动查看仪表板。

AWS在机器学习和自动化推理领域已深耕逾十年。"随着大语言模型的普及,我们现在能够以前所未有的规模,将这些系统应用于广泛的技术和业务问题,"Islam说。

DPR Construction:AI驱动的施工前期规划与现场机器人

总部位于加利福尼亚州圣克拉拉的全国性承包商DPR Construction承接数据中心等多类设施的建设项目,近年来加大了对AI的投入,助力员工在建设项目中做出更优决策,项目执行官Max Lares表示。

过去两至三年间,公司将AI用于施工早期阶段的数据分析,依托以往项目的基准数据(包括场地条件、成本模型和施工排序),预测新项目的人员需求、工期及施工顺序,并协助租户进行成本与价值预测。

团队会运行模拟仿真,从基础施工、钢结构安装到机械、电气和消防系统,对全流程施工顺序进行规划,Lares表示。这有助于DPR判断是从建筑中部还是从一端向另一端推进施工更为合理。

DPR还在试点夜间巡检机器人,机器人在工地夜间自主行走并拍摄照片,便于客户随时掌握施工进度。引入机器人后,施工团队无需在工作时间自行移动摄像机拍照。Lares表示,机器人拍摄的影像质量也更高。"机器人可以在工地无人的时段自行巡视并为我们拍摄照片,由于没有施工活动,拍摄视角更全面,整个施工区域都一览无余。"

Lares强调,提升效率和服务质量是首要目标,但公司不会用AI取代人类判断。"AI对我们来说是很好的工具,但我们仍然对自己的决策负全责。"

施耐德电气:数字孪生、DCIM与规范化的规模AI部署

施耐德电气为数据中心提供电力、冷却及其他基础设施产品,同时将AI应用于自身产品与内部运营。

数据中心运营商可通过施耐德的ETAP电力系统建模软件和AVEVA工业运营软件,结合英伟达技术,构建电力和冷却基础设施的数字孪生体。AI与数字孪生技术使运营商能够在对真实系统作出变更之前,先行运行仿真并预测系统行为。

施耐德的EcoStruxure IT软件还支持运营商持续监控基础设施,并利用AI实现远程诊断、主动建议和预测性维护。

在服务调度方面,施耐德将AI集成到EcoCare服务中,用于推荐合适的技术人员、可能需要更换的零部件及维修紧急程度,但最终派单决策仍由人工调度员做出,首席数据中心与AI倡导官Steven Carlini表示,"整个过程有人工介入。目前和大多数AI应用一样,这套系统还未实现完全的智能体化或自主运营。"

在企业内部,施耐德的AI应用之路始于八年前,但长期停留在试点阶段。约一年半前,公司开始推动AI在业务层面的规模化落地,运营卓越与AI副总裁Jennifer Swen表示。例如,公司上线了一套智能体系统,用于处理客户报价请求,将原本62个步骤缩减至14个,响应周期缩短约95%。公司还借助AI为销售团队准备客户会议,将客户历史记录、未决商机和销售管道数据汇总成一份简报。

所有内部AI工具均运行在统一管理的云平台之上,并受到公司首席AI官的严格监督。"我们对所有AI解决方案都实施了非常严格的风险管控和治理流程,"Swen说。

下一步:IT与OT融合及智能体化控制

Illsley指出,AI在数据中心IT侧(包括服务器、存储和应用)的成熟度,高于运营技术(OT)侧(包括配电、冷却及其他设施基础设施)。

在IT侧,AI主要通过AIOps工具部署,摄入日志、追踪信息和遥测数据以检测异常。"大量信息被持续写入和输出,工具从这些噪声中提取信号,并提示运营人员做出进一步处理。"这可能意味着在工程师发现问题之前,系统已提前标记出数据库损坏、磁盘满载或网络故障等情况。

OT侧正在奋起追赶。施耐德电气、西门子等厂商正在将AI集成到数据中心基础设施管理(DCIM)系统中,用于监控配电、冷却、泵、阀门和冷水机组,并诊断冷水机过滤器堵塞等异常情况。

在Illsley看来,下一个合理的步骤是将IT和OT数据整合到一个共享层,使AI能够同时看到两端,帮助运营商做出比单边更智能、更全面的决策,而IT和OT工具本身保持独立运作。

这座连接IT与OT的"桥梁"已初现雏形。S&P Global旗下451 Research高级研究分析师Zoe Roth表示,一批新兴的"智能体分析"初创公司正在构建叠加于现有冷却和电力系统之上的解决方案,通过智能编排冷却和热管理来降低能耗。其中,初创公司Phaidra还接入了IT系统的遥测数据,使运营商能够跨楼宇管理、电力、冷却和IT系统实现全链路可见。其强化学习智能体利用这些数据生成冷却基础设施的控制指令,帮助设备维持更稳定、更高效的温度。

数据中心会走向完全自主运营吗?

即便AI能力持续提升,分析师仍认为完全自主的数据中心在目前来看仍是遥远的可能性——不是因为技术做不到,而是信任问题。

"AI完全有能力独立运营一个数据中心,这几乎毫无疑问,"Illsley说,"但我们愿意信任它吗?恐怕不行。"

S&P Global旗下451 Research研究总监Dan Thompson表示,对于那些人员难以抵达的数据中心——例如阿拉斯加北坡的偏远设施——情况则有所不同。这类数据中心将不得不自主运行,或至少与人工团队保持高度互联以支持远程故障排查。

同理,太空数据中心也面临类似挑战。"每次出现问题就派宇航员进入太空,显然不现实,"Thompson指出。

但对于普通数据中心而言,在可预见的未来,人类仍将参与其中。"在我看来,至少目前,普通数据中心运营商最希望得到的,是更好的信息支持,帮助他们判断该做什么以及最优的行动方案,"Thompson说。

即便AI智能体承担了越来越多的具体任务,仍然需要有人对现场发生的一切负责。

"你要对那个数据中心负责,而不是那个以每小时500万英里速度飞驰的AI智能体,"Illsley说。

Q&A

Q1:Digital Realty的OPDaaS平台具体是如何优化数据中心运营的?

A:OPDaaS是Digital Realty自研的"运营数据即服务"平台,能够以亚秒级频率采集供电、冷却等楼宇系统的遥测数据,并通过API开放给内外部工具进行分析。AI可据此检测风冷系统滤网堵塞、动态调节冷却负载等,实现双位数百分比的效率提升。该平台帮助公司在规模扩展34%的同时,用水量仅增长3%,并在2025年节省了17,800兆瓦时的电力。

Q2:AWS是如何用AI智能体处理网络故障的?

A:AWS的AI智能体能够在网络出现故障时,自动关联来自多个监控系统的遥测数据,在数秒内定位问题根因,而非传统的数分钟。对于日常运营问题,AI还能自动审查工单、对比历史模式,并在许多情况下无需人工干预直接解决问题,从而释放工程师处理更复杂的任务。AWS表示,已在机器学习和自动推理领域深耕超过十年。

Q3:数据中心未来会实现完全自主运营吗?

A:分析师认为,完全自主运营目前仍是遥远的愿景,核心障碍不在于技术能力,而在于信任。大多数运营商仍希望AI提供决策支持,而非替代人类判断。例外情况包括人员难以抵达的偏远设施或太空数据中心,这类场景可能率先推动自主运营落地。对于普通数据中心,人类在可预见的未来仍将承担最终责任。

DataCenterKnowledge