GitHub在经历近8小时的服务中断后终于恢复正常,此次故障波及多项核心开发工具,包括Actions、Pull Request、API、Git操作、Webhooks以及Copilot,对整个平台上的软件开发工作流程造成了广泛影响。

"此次事故已得到解决,感谢大家在我们处理问题期间的耐心与理解。"GitHub在其状态页面上写道。

此次中断最早于UTC时间8月17日下午1时40分被报告,GitHub起初将其定性为平台部分区域性能下降。短短数分钟内,故障便蔓延至API请求、Actions、Webhooks、Issues以及Pull Request等功能。

在事故最严峻时期,GitHub报告其网页端和API流量的错误率约达20%。归档文件下载及原始仓库内容下载的错误率则高达约50%,SAML与OIDC身份验证、SCIM以及Team Sync同步功能也均受到影响。

GitHub旗下AI编程助手Copilot从UTC时间下午2时31分起同样出现可用性下降的问题。该公司随后表示,即便平台其他部分已逐步恢复,部分Copilot的身份验证问题仍持续存在。

UTC时间下午4时36分,GitHub表示已定位到问题组件并采取了纠正措施。

然而,服务恢复的过程并非一帆风顺。

Git操作再度出现性能下降,API请求也短暂回归降级状态。GitHub随后表示,已于UTC时间晚上7时01分缓解Git操作问题并恢复了API的正常运行。

尽管如此,其他服务仍持续受到影响,问题主要集中在身份验证环节。GitHub表示,在观察到零星的身份验证失败后,已部分禁用身份验证Token重试机制,并表示Copilot的身份验证问题仍在影响部分应用程序。

"我们正在持续调查零星出现的身份验证失败问题。目前已部分禁用身份验证Token重试机制,并观察到有所改善,我们将在全面应用该缓解措施之前持续监测影响范围。"GitHub写道。

上述问题最终于UTC时间晚上8时45分得到修复,事故在UTC时间晚上9时15分被正式标记为已解决,距首次报告已历经近8小时。

尽管此次事故并未导致GitHub完全停摆,但受影响服务的数量和性质对于企业开发团队而言影响重大——该公司如今承担的职能已远不止是一个代码托管仓库。

开发团队将其API、Actions工作流、Pull Request及各类集成作为软件交付流程中相互关联的组成部分。因此,即便基本的仓库访问功能仍可使用,多项组件同时出现故障也足以对整体工作流程造成冲击。

目前,GitHub尚未明确说明导致故障的"问题组件"究竟是什么,以及为何该组件的失效会同时波及如此多的服务。

在官方的事后分析报告发布之前,此次中断究竟是由基础设施故障、软件变更、身份验证问题还是攻击等其他原因所致,仍不得而知。

就目前而言,GitHub状态页面表示:"详细的根本原因分析将在准备就绪后第一时间公布。"

Q&A

Q1:GitHub此次服务中断持续了多长时间,哪些功能受到了影响?

A:此次GitHub服务中断从UTC时间8月17日下午1时40分持续至晚上9时15分,历时近8小时。受影响的功能涵盖Actions、Pull Request、API请求、Git操作、Webhooks、Issues以及AI编程助手Copilot,平台网页端和API流量的错误率一度高达20%,部分下载服务的错误率更达到约50%。

Q2:GitHub这次服务中断的根本原因是什么?

A:目前GitHub尚未公布根本原因。官方仅表示已定位到"问题组件"并采取了纠正措施,但未透露该组件的具体信息。在正式的事后分析报告发布之前,外界无法确认此次故障究竟源于基础设施故障、软件变更、身份验证问题还是外部攻击。GitHub状态页面表示,详细的根因分析将在准备就绪后尽快公布。

Q3:GitHub服务中断对企业开发团队有什么影响?

A:对于将GitHub深度整合到软件交付流程中的企业开发团队而言,此次中断影响不可忽视。现代开发流程高度依赖GitHub的API、Actions自动化工作流、Pull Request代码审查以及各类集成工具,多项核心组件同时出现故障,即便基本的代码仓库访问功能尚可使用,整体开发工作流程仍会受到显著冲击,进而影响持续集成与持续交付等关键环节。

Computerworld