最具破坏性的IT故障很少是在系统突然停止运行时才开始的。更多情况下,问题的根源要追溯到数月之前——某个警告被忽视了,某次替换被推迟了,或者某个临时性的例外变成了永久的常态。

这种损害起初并不明显。团队反复处理与同一老旧系统相关的事件,但每次都把它当作独立事件来处理。工单被关闭了,报告看起来一切正常。然而潜在的风险却在持续累积。

在Uptime Institute发布的《2025年全球数据中心调查》中,1677名受访者中有57%表示,他们最近一次重大停机事故的损失超过10万美元,而在2025年和2026年的调查中,均有五分之一的受访者报告损失超过100万美元。并非每次停机都源于延迟维护,但未解决的运营隐患很容易演变成实质性的风险敞口。

积压问题远不止是补丁那么简单

我所说的维护积压,不仅指过期的补丁、老化的硬件或未关闭的工单,而是指为了保持系统安全、可支持、可理解,并适应业务流程所需要完成的全部累积工作。

那些不那么显眼的积压问题包括:无人认领的设备和集成系统、执行关键工作的不受支持的应用程序、未记录的配置变更、从未真正消除的重复性事件、闲置的许可证、被遗忘的账户,以及演变成标准流程的临时性变通方案。

这些因素叠加在一起,会在管理者对技术环境实际运作方式的认知与其真实运作情况之间,制造出越来越大的鸿沟。维护工作与其业务后果之间的关联往往未被足够清晰地建立起来。

延迟处理会使问题复杂化

延迟维护不会孤立地停留在IT工单队列中。老旧或不被充分理解的技术会导致重复性事件、更缓慢的故障排查以及停机。监控系统或许能够发现不受支持的设备、未打补丁的软件和被遗忘的账户,但它无法解决这些问题。

延迟处理还可能导致许可证闲置、紧急替换以及在本该淘汰的系统上持续投入。CIO们可能因此基于不完整的信息做出生命周期决策,反而使他们试图解决的问题变得更糟。

这些问题会相互叠加。所有权缺失会延误补丁部署,而不完整的历史记录会拖慢诊断速度。延迟替换会引发更多事件,反复的变通方案则让系统更难以更改。记录不完善又会削弱未来自动化的实施效果。

每一次被推迟的决策,都会增加下一次决策的成本和不确定性。

AI无法解决维护债务问题

这一切还是在引入AI之前的情况。AI正逐渐成为IT团队分类事件、推荐应对方案和自动执行常规操作的一部分。但这恰恰使被忽视的维护问题变得更加严重,而非有所缓解。

以AI助手为例,它可能能够准确总结某个事件,但却缺乏推荐安全应对方案所需的背景信息。谁拥有这个系统?哪个服务依赖于它?它的配置最近是否发生过变更?某项自动化操作是否会干扰其他工作流程?如果没有这些答案的支撑,AI操作的价值就会受到限制。

更广泛地说,如果不确定性、人工监督和审批要求没有被纳入控制体系,自动化工作流程可能无法大规模执行。美国国家标准与技术研究院(NIST)将背景信息、数据和人工监督视为AI风险的重要维度。NIST的《生成式AI风险管理框架》也将自动化偏见——即对自动化输出过度依赖——列为一项风险因素。

这意味着自动化无法消除维护债务,反而会加快不完整记录、模糊所有权和被忽视的依赖关系产生后果的速度。

工单时长不等于业务风险

大多数维护报告衡量的是活动量,比如未关闭任务数、平均积压时长、补丁完成率、已关闭工单数或资产更新数量。但这些指标并不能反映真实的风险敞口。

一个存在已久但影响较小的任务可能不会带来太大的即时风险;而一个新发现、与关键流程相连、不受支持的系统,可能才是真正紧迫的问题。CIO们应该问:哪个服务依赖于它?如果它出现故障会发生什么?是否有人已经承担了这一风险?

维护工作应该按后果的严重程度而不是任务时长来排定优先级。CIO需要将积压问题作为一个业务风险组合来管理,而不仅仅是一份任务队列。以下四项行动可以帮助实现这一转变。

将工作与业务依赖关系相连接。将重要的维护事项与依赖受影响技术的员工、地点、系统和服务关联起来。

将延迟工作与已接受的风险区分开来。记录工作被推迟的原因、可能产生的后果、谁接受了这一风险敞口,以及何时将对该决策进行复审。

识别反复出现的问题模式。不要只关注单个工单,而要识别反复受影响的设备、被推迟的补丁、延长的支持协议,以及已经变成标准流程的变通方案。

报告风险敞口,而非仅仅报告完成情况。展示受影响的业务服务、不受支持的关键技术、反复出现的事件、无人负责的决策以及进一步延迟可能产生的成本。

这样做的目的并不是要将每一项维护任务都升级为紧急事项,而是确保重大风险敞口能够得到明确的业务决策。

没有一位CIO拥有无限的人员、资金或维护窗口时间。没有任何组织能够彻底清除积压中的每一项任务。但每个组织都应该清楚,这些积压究竟带来了怎样的风险。

当务之急是防止延迟工作变得不可见、无人负责,并与其业务后果脱节。一旦将积压问题视为一个风险组合来对待,问题就会从"IT关闭了多少任务"转变为"我们正在承担哪些风险,为什么承担,又是谁同意承担这些风险的?"

您是如何应对维护积压问题的?AI是否改变了您处理IT工单的方式?

Q&A

Q1:什么是维护积压?

A:维护积压不仅指过期的补丁、老化的硬件或未关闭的工单,而是指为保持系统安全、可支持、可理解并适应业务流程所需完成的全部累积工作,包括无人认领的设备、未记录的配置变更等隐性问题。

Q2:AI能帮助解决维护积压问题吗?

A:不能完全解决。AI可以帮助分类事件和推荐方案,但如果缺乏系统所有权、依赖关系等背景信息,AI的建议价值会受限,反而会加快隐患暴露的速度。

Q3:如何正确评估维护任务的优先级?

A:不应仅按任务时长排序,而应按业务后果的严重程度排序,重点关注该系统依赖的业务服务、故障后果以及是否有人已经承担相关风险。

InformationWeek