微软云服务与Azure托管在美国西海岸的服务于近日发生大规模中断,网络连接故障导致服务瘫痪长达数小时。此次故障期间,虽然完全运行在微软美国西部云区域内部的服务未受影响,但所有进出该设施的流量均受到波及。

目前,微软已发布初步事故事后审查报告(PIR),确认此次中断发生于7月23日协调世界时14时44分至19时41分(太平洋时间上午7时44分),持续时间约为5小时。事故根本原因是:工程师在对某台设备执行例行维护隔离操作时,误删了一组IP路由。

据报告披露,在启动维护作业之前,微软已核查确认通往该设施的两条冗余链路中至少有一条保持正常运行。然而,在实际开始操作时,自动化系统将部分额外设备纳入了隔离范围,随之移除了若干未包含在初始评估方案中的IP路由,最终引发连锁故障。

用户很快察觉到服务异常,工程师在故障发生后第一个小时内便定位到问题根源,并随即启动服务恢复工作。微软方面表示,此次中断与近期的"光纤维护作业"存在关联。

针对如何降低此类操作失误引发中断的风险,微软建议承载关键任务数据的企业机构采用多区域部署策略,以提升业务连续性保障能力。

此次Azure中断是微软今年以来发生的第二次重大故障。今年2月,美国西部和东部区域曾出现一次长达10小时的服务中断事故。

Q&A

Q1:微软美国西部Azure此次中断的直接原因是什么?

A:此次中断的直接原因是工程师在对设备进行例行维护隔离时,自动化系统将额外设备纳入隔离范围,误删了一组原本不在计划内的IP路由,导致进出美国西部云设施的网络连接全面中断,故障持续约5小时。

Q2:微软Azure此次故障影响了哪些服务?

A:此次故障主要影响所有需要进出美国西部云区域的网络流量,即依赖外部连接的云服务均受到波及。完全运行在微软美国西部云区域内部、无需对外通信的服务则未受影响。

Q3:微软建议企业如何避免类似云服务中断带来的损失?

A:微软建议承载关键任务数据的企业采用多区域部署(Multi-region)策略,即将业务分布在多个云区域,避免单一区域故障导致整体业务瘫痪,从而提升服务的高可用性和业务连续性。

Networkworld