全球最大的代码托管平台 GitHub 于本周发生一起持续近八小时的宕机事故,事故波及 Issues、Pull Requests、API、Actions 和 Copilot 等多项核心服务。GitHub 官方在事后发布的事故报告中披露,事故直接原因为美国中部数据中心的负载均衡器网络饱和,叠加自动扩容策略配置错误及 Visual Studio Code 客户端重试机制故障等多重因素,导致故障影响时间被显著拉长。
根据 GitHub 公布的时间线,本次宕机始于 8 月 17 日 13:28 UTC,直至 21:15 UTC 才完全恢复,总计持续 7 小时 47 分钟。在此期间,开发者大量依赖的代码协作功能出现错误或不可用,API 调用失败率显著上升,GitHub Actions 的构建任务也受到牵连。事故发生后,开发者社区中关于寻找替代平台的讨论再度升温。
GitHub 在报告中解释,故障的起点是负载均衡器在网络层面出现饱和,但随后的连锁反应放大了影响范围。自动扩容策略在配置上存在错误,未能及时增加资源以缓解压力;同时,Visual Studio Code 客户端中的某个重试逻辑 bug 导致请求流量被放大 10 倍,进一步加剧了负载均衡器的过载状况。这些因素相互叠加,使故障恢复时间远超预期。
这并非 GitHub 今年首次遭遇大规模服务中断。此前,该公司已多次出现不同程度的宕机事件,部分知名开源项目已陆续宣布将代码仓库迁移至其他托管平台。频繁的稳定性问题正在对 GitHub 在企业级市场和开发者群体中的信任度构成挑战。
对于依赖 GitHub 进行日常开发和 CI/CD 流程的企业团队而言,此次事件再次凸显了多云备份和灾备方案的重要性。GitHub 方面表示,后续将针对负载均衡架构、扩容策略及客户端重试机制进行系统性修复,并加强相关场景的故障演练,以降低同类事件再次发生的概率。
该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。