数据中心的韧性正日益受到关注,而安全则是其中的核心议题。由于经济增长和安全运营对数据中心的依赖程度不断提升,这些设施越来越被视为关键基础设施。
然而,相关讨论往往止步于外部边界。在围栏之内,另一类尚未得到充分审视的风险正在悄然积聚——那就是维持设施运转的运营技术(OT)与网络物理系统(CPS)。不间断电源(UPS)、配电单元(PDU)、冷却系统、环境传感器以及楼宇管理平台,如今已普遍实现联网,而所采用的远程访问工具和传统协议,往往并非为当今的威胁环境所设计。
这些并非IT系统,大多数组织也未将其纳入同等的安全治理框架。一旦该层级遭到攻击,往往不会以"入侵"的形式呈现,而是表现为"中断"。随着AI驱动的需求加速了对联网运营基础设施的依赖,这些系统所承载的风险规模也随之扩大。负责训练和运行AI模型的设施已成为战略性资产,而中断事件的代价,也随着所有依赖它们的业务而同步攀升。
你的设施是一个网络物理生态系统
大多数运营者对数据中心的物理布局有直观认知:承载IT负载的"白色空间",以及承载电力和暖通空调设施的"灰色空间"。问题在于,组织架构的演进速度远未跟上技术变革的步伐。设施团队用电压和冷却量沟通,安全团队则用数据包和漏洞交流。
传统安全框架并非为这种环境而构建,双方也都缺乏将对方的风险转化为可操作行动的工具。由此产生的,是权责归属、可见性与优先级排序上的空白地带,而中断事件往往正从这里孕育而生。
这也改变了安全事件的呈现方式。企业IT安全的核心在于保障信息保密性,而在设施环境中,主要后果往往是业务中断——可能是意外的关机行为、错误读数与告警延迟,或是导致热降频的冷却性能下降。情况严重时,机架级别的电力故障等局部事件,可能引发向上游设施系统的连锁反应。
这一区别,应当影响领导者衡量安全成效的方式。问题不再仅仅是"我们是否阻止了入侵",而是"在入侵发生期间,我们能否维持安全运营"。这才是韧性的核心所在。
风险规模远超大多数人的认知
这一话题滞后的原因之一,在于我们尚未充分意识到重大故障的连锁影响。
当一个关键行业陷入瘫痪,其他行业会迅速受到波及。以医院为例,其正常运转不仅依赖医护人员和建筑设施,还需要病历系统、交通运输、药品冷链储存以及稳定的环境控制电力。一旦这些支撑系统失效,医疗工作虽能勉强持续,但将变得更加依赖人工操作,速度更慢,风险更高。
将同样的视角投射到数据中心:随着AI日益成为企业运营、供应链管理和国家安全分析与决策的基础依赖,数据中心的正常运行已不再只是服务可用性问题,而上升为经济安全与公共安全问题。
挑战不仅在于数据中心数量的增多,更在于其设计、建设和投入运营的速度前所未有,使得治理规范、安全验证和运营成熟度难以同步跟进。
超高速增长正在催生新风险
超高速增长意味着治理正疲于追赶——面对不断新增的站点、快速部署的设备和压缩的上线周期,管控难度与日俱增。当组织每三个月就开工一座新数据中心时,速度本身便在供应链和运营质量层面引入了诸多挑战。
供应链方面:为现代数据中心提供电力和冷却支撑的技术正在快速迭代演进。许多新进供应商,包括初创企业和来自半可信地区的厂商,可能缺乏成熟的安全软件开发生命周期(SDLC)和生产制造流程。随着这些技术嵌入关键基础设施,健全的CPS项目对于管理第三方风险至关重要。
质量方面:市场奖励速度,数十亿美元的投资往往押注于能否按时完成激进的部署计划。当承包商、第三方和内部团队以前所未有的速度推进工作时,速度驱动的失误也愈发常见。现实案例包括:网络分段配置错误(VLAN)、端口暴露,以及默认凭证未经修改等问题。
速度已成为竞争优势,但同时也成为安全隐患。若治理不能同步跟进,组织将面临在当下运营盲区之上构建未来关键基础设施的风险。
研究揭示的真实图景
近期的研究成果直接揭示了这些漏洞与运营中断之间的映射关系。一份最新报告发现,用于管理UPS系统的网络接口存在接近最高危级别的安全缺陷。身份验证绕过与远程代码执行漏洞的组合,在最坏情况下,可使攻击者绕过登录控制并下发中断受保护负载供电的指令。在数据中心环境中,这绝非小事,而是潜在的设施级停电事件。
另有研究揭露了一款广泛部署的暖通空调控制器中存在的一系列漏洞,包括无需身份验证即可获得root级别远程访问权限,以及敏感设施数据的暴露风险。这类漏洞链的组合,可使攻击者掌握对冷却系统的控制能力,而冷却系统直接决定高密度工作负载能否稳定运行。冷却并非辅助系统,而是正常运行的基础依赖。随着机架密度持续提升,散热余量也在不断收窄。
比具体漏洞本身更值得关注的,是其背后呈现的规律:在上述两个案例中,大多数IT安全团队几乎从不关注的设备,恰恰正是决定设施能否保持在线的关键所在。
弥合差距的路径
许多网络物理设备在设计之初,面向的是连接有限、威胁模型截然不同的时代,其核心目标是保障运行时间和可维护性。如今,网络连接已成为业务需求,远程维护日趋普及,而这些系统往往完全游离于传统IT漏洞管理体系之外。设施团队掌握着供应商关系,却缺乏追踪固件风险的工作流程;安全团队懂得如何推进漏洞管理,却未将这些资产纳入资产清单。
应对之策,首先从灰色空间和白色空间的资产可见性入手,全面掌握设施内存在哪些资产、其位置分布、通信对象,以及所运行的协议和固件版本。将这些资产与其运营用途相映射,使修复措施和补偿性控制优先聚焦于对正常运行时间最为关键的部分。在此基础上,将网络分段作为一项核心的运行时间控制手段:限制通信范围至必要范围,将管理流量限制在授权路径上,并将控制网络与业务网络隔离,防止单点攻破演变为全设施事件。对远程访问也应采用同等严格的管理规范,对供应商和承包商强制执行强身份验证、最小权限原则以及可审计的会话记录。
最后,将检测与响应纳入网络物理纪律体系,将安全事件与运营异常进行关联分析,并确保应急预案充分考虑监控与控制系统遭受操控的场景,最终目标是防止安全事件演变为运营中断。
为何这是管理层必须直面的议题
保险机构越来越期望看到可审计的网络物理控制证明,以验证运营韧性。这意味着需要具备CPS资产可见性、能够限制影响半径的分段措施、受治理的远程访问机制,以及能够呈现持续进展的报告体系。这些期望正日益对标其他关键基础设施行业的严格标准。
这一转变将OT安全从技术讨论提升为业务议题。如果正常运行时间是产品,那么网络物理韧性便是产品质量的组成部分。
行业将关注重心放在物理威胁和边界安全上是正确的。但那些维持数据中心灯火通明、服务器保持低温运行、电力持续供应的系统,同样值得获得相同程度的审视。因为当这一层级发生故障时,新闻标题往往不会写"遭遇入侵",而是"系统中断"。
Q&A
Q1:数据中心OT安全和传统IT安全有什么区别?
A:传统IT安全主要围绕信息保密性构建,核心目标是防止数据泄露。而数据中心的OT安全关注的是运营连续性,主要后果是业务中断,而非数据被盗。OT系统包括UPS、冷却系统、配电单元等,一旦遭到攻击,可能表现为设备异常关机、冷却失效或电力中断,外观上更像是硬件故障而非网络入侵,因此更容易被忽视。
Q2:UPS和冷却系统的安全漏洞具体有多危险?
A:研究发现,UPS网络管理接口存在接近最高危级别的漏洞,攻击者可绕过身份验证并远程执行代码,进而中断受保护负载的供电,可能引发整个设施级别的停电。暖通空调控制器则存在无需认证即可获得root权限的漏洞,攻击者一旦控制冷却系统,可直接威胁高密度服务器的稳定运行。随着机架密度不断提升,散热余量减少,此类攻击的破坏潜力也在持续放大。
Q3:数据中心应如何提升OT和CPS系统的安全防护水平?
A:核心措施包括四个方面:一是建立覆盖灰色空间和白色空间的完整资产清单,掌握所有设备的协议和固件版本;二是将网络分段作为正常运行时间的核心控制手段,隔离控制网络与业务网络;三是对远程访问严格执行强身份验证和最小权限原则;四是将安全事件检测与运营异常关联分析,确保应急预案涵盖控制系统被操控的场景,防止安全事件演变为运营中断。
