数据中心的韧性正日益受到关注,安全已成为其中的核心议题。由于经济增长和安全运营对数据中心的依赖程度不断加深,它们越来越被视为关键基础设施。

然而,讨论往往止步于边界防护。在设施内部,一种独立且长期被忽视的风险正在累积:运营技术(OT)与网络物理系统(CPS)。不间断电源(UPS)、配电单元(PDU)、冷却系统、环境传感器和楼宇管理平台如今已普遍联网,却往往依赖远程访问工具和从未为当下威胁环境设计的传统协议。

这些并非IT系统,而大多数组织也并未将其纳入IT治理体系。一旦这一层面遭到攻击,往往不会表现为明显的入侵事件,而是以故障停机的形式呈现。随着AI驱动的需求加速推动对联网运营基础设施的依赖,这些系统所承载的代价也在不断攀升。用于训练和运行大语言模型的数据中心如今已是战略性资产,而一次停机的代价,与依赖这些系统的所有业务息息相关。

您的设施是一个网络物理生态系统

大多数运营者对数据中心的物理构成有直觉性的了解:白色空间承载IT负载,灰色空间容纳设施供配电和暖通空调系统。挑战在于,组织架构的演进远远跟不上技术的步伐。设施团队的语言是电压和制冷;安全团队的语言是数据包和漏洞。

传统安全框架既未针对这一环境设计,双方也都缺乏将对方的风险转化为可操作行动的工具,由此形成所有权、可见性和优先级排序上的缺口,而故障往往就在这一缺口中悄然发生。

这一现实也改变了安全事件的呈现方式。企业IT安全主要围绕机密性构建,而在设施环境中,主要后果往往是业务中断,具体表现为意外的停机行为、误报读数与告警延迟,或冷却降级引发的热节流。在最坏的情况下,一次局部故障(如机架级电源事件)可能级联蔓延至上游设施系统。

这一区别应当改变领导者衡量安全成果的方式。核心问题不仅仅是"我们能否阻止入侵?",而是"在遭遇入侵期间,我们能否维持安全运营?"——这才是韧性的本质。

风险远超多数人的认知

这一话题之所以讨论滞后,部分原因在于我们尚未充分认识到重大故障的连锁影响。

当某个关键领域出现故障,其他领域会迅速随之退化。以医院为例,其运转依赖的不仅是医护人员和建筑设施,还包括病历系统、交通运输、药品冷链储存以及稳定的环境调控电力。一旦这些支撑系统失效,医疗服务或许还能继续,但将被迫转为手动模式,变得更慢、更危险。

将这一逻辑延伸至数据中心:当AI成为企业运营、供应链管理乃至国家安全系统分析与决策的基础依赖,数据中心的正常运行时间便不再只是服务可用性问题,而是经济安全与公共安全问题。

挑战不在于数据中心数量的增多,而在于它们正以前所未有的速度被设计、建造和投入使用,使得治理、安全验证与运营成熟度难以同步跟进。

超高速增长正在制造新的风险

在超高速增长阶段,治理体系往往难以跟上新增站点、快速部署设备和压缩部署周期的步伐。当组织每三个月就开工一座新数据中心时,速度本身便会在整个供应链和运营质量层面引发连锁挑战。

供应链方面:驱动现代数据中心供配电和制冷的技术正在快速演进。许多新供应商,包括初创企业和来自半信任地区的供应商,可能缺乏成熟的安全软件开发生命周期(SDLC)和制造流程。随着这些技术嵌入关键基础设施,健全的CPS程序对于管理第三方风险至关重要。

质量方面:市场以速度论英雄,激进的部署时间表往往意味着数十亿美元的利益博弈。当承包商、第三方和内部团队以前所未有的速度推进工作时,速度驱动的错误也随之增多。现实案例包括:网络分段(VLAN)配置错误、端口暴露以及默认凭证未作更改。

速度已成为竞争优势,但也已演变为安全负债。若治理体系无法同步跟进,组织便可能将明日的关键基础设施建立在今日的运营盲区之上。

研究数据揭示的真相

近期研究成果直观呈现了这些漏洞与运营中断之间的关联。一份近期报告披露了用于管理UPS系统的网络接口中存在的近最高严重级别缺陷。一旦认证绕过与远程代码执行漏洞相结合,攻击者最坏情况下可绕过登录控制,向受保护负载发出断电指令。对于数据中心而言,这不是小问题,而是可能引发设施级停机的重大事件。

另有研究发现了一款广泛部署的暖通空调控制器中存在的漏洞链,包括无需身份验证即可获得root级远程访问权限的路径,以及敏感设施数据的暴露。此类漏洞组合可使攻击者直接操控冷却系统,而冷却状态直接决定高密度工作负载能否稳定运行。冷却系统绝非后台功能,它是正常运行时间的关键依赖——随着机架密度不断提升,热裕量也在持续收窄。

这一规律比具体风险本身更值得关注:在上述两种情形中,大多数IT安全团队鲜少关注的设备,恰恰是决定设施能否保持在线的核心设备。

弥合安全缺口

许多网络物理设备在设计之初,面向的是有限连接时代的高可用性和可维护性需求,基于的是截然不同的威胁模型。而今,连接性是业务刚需,远程运维已司空见惯,而这些系统往往完全游离于传统IT漏洞管理体系之外。设施团队掌握供应商关系,却缺乏追踪固件风险的工作流;安全团队具备漏洞管理的落地能力,却未将这些资产纳入资产清单。

应对之道,首先是实现灰色空间与白色空间的全面资产可见性,明确所有设备的存在状态、位置、通信对象及其运行的协议和固件版本。将资产映射至运营功能,确保修复措施和补偿性控制优先覆盖对正常运行时间影响最大的关键环节。在此基础上,将网络分段作为首要的正常运行时间控制手段——将通信限制在必要范围内,将管理流量限定于授权路径,并将控制网络与业务网络隔离,避免一次攻击演变为全设施事件。对远程访问同样适用相同的管控标准:对供应商和承包商执行强身份验证、最小权限原则和可审计会话管理。

最后,将检测与响应作为网络物理学科加以对待,将安全事件与运营异常相关联,确保应急预案覆盖对监控和控制系统的操控场景,将目标定位于防止事件演变为停机。

这是管理层必须直视的议题

保险公司越来越期望企业提供可审计的网络物理控制证明,以验证运营韧性。这意味着需要具备CPS资产可见性、限制爆炸半径的网络分段、受治理的远程访问机制,以及能体现持续改进的报告能力。这些预期日益与其他关键基础设施领域所适用的标准趋于一致。

这一转变意味着OT安全已从技术讨论升级为业务命题。如果正常运行时间是产品本身,那么网络物理韧性就是产品质量的组成部分。

行业对物理威胁和边界安全的关注无疑是正确的,但维系电力、保持服务器冷却、确保电力稳定输送的那些系统,同样值得同等程度的重视。因为一旦这一层面失效,新闻头条往往不会写"遭遇入侵",而只会写"发生故障"。

Q&A

Q1:数据中心OT系统面临哪些主要安全漏洞?

A:研究表明,用于管理UPS系统的网络接口存在近最高严重级别的缺陷,认证绕过结合远程代码执行漏洞可使攻击者向受保护负载发出断电指令,从而引发设施级停机。此外,广泛部署的暖通空调控制器也被发现存在漏洞链,攻击者可在无需身份验证的情况下获得root级远程访问权限,并暴露敏感设施数据,直接威胁冷却系统稳定性。

Q2:数据中心OT安全问题为什么长期被忽视?

A:主要原因在于组织架构的割裂:设施团队负责供应商关系但缺乏固件风险追踪能力,安全团队具备漏洞管理能力但未将OT资产纳入清单。此外,传统安全框架围绕机密性构建,而OT系统的主要安全后果是业务中断,两者的风险语言和应对体系存在根本差异。超高速建设也使治理体系难以同步跟进。

Q3:如何有效弥合数据中心OT安全缺口?

A:首要措施是实现灰色空间与白色空间的全面资产可见性,明确所有设备的通信关系和固件版本;其次将网络分段作为正常运行时间的核心控制手段,隔离控制网络与业务网络;同时对供应商和承包商执行强身份验证与最小权限管理;最后将检测响应延伸至网络物理层面,确保安全事件与运营异常相关联,防止事件升级为停机。

DataCenterKnowledge