GitHub公布8月17日宕机调查结果:基础设施容量不足致多项服务中断近8小时

本次大规模宕机合计造成 GitHub 网站、身份验证、GitHub Actions、API、Pull Request、Issues 等多项服务中断 7 小时 47 分钟。

8月21日,GitHub 公布了 8 月 17 日平台大规模宕机事件的调查结果,确认此次事故并非由程序代码或配置变更引起,而是基础设施容量未能跟上平台使用量的快速增长。本次大规模宕机合计造成 GitHub 网站、身份验证、GitHub Actions、API、Pull Request、Issues 等多项服务中断 7 小时 47 分钟。

GitHub 表示,当日平台流量创下历史新高后,美国中部数据中心的一项关键基础设施组件容量不足,导致压力扩散至其他系统,进而引发身份验证失败及多项服务异常。在恢复过程中,部分服务因错误触发客户端重试机制,进一步增加系统流量,最终技术人员花费较长时间才完全恢复平台服务。

这已是 GitHub 本月发生的第二起重大服务事故。此前,GitHub Actions 已在 8 月 6 日发生服务故障。GitHub 指出,两起事故的核心问题均为基础设施容量不足,而非程序代码或配置变更导致的故障。

GitHub 近期平台使用量增长迅速。今年 4 月至今,每月提交(commit)次数已从 14 亿次增加至 29 亿次,合并 Pull Request 以及新建代码仓库的数量也持续增长。为应对使用量持续攀升,GitHub 今年已增加超过 300 万个 CPU 核心、120PB 高速存储空间及网络容量,并加快将工作负载迁移至微软 Azure。目前约 58% 的 GitHub 平台负载已由 Azure 承载,远高于今年 5 月的 12%;约一半的 Git 操作也已由 Azure 负责处理。

尽管微软采取了上述优化措施,仍出现了用户量挤垮平台服务的情况。GitHub 表示,接下来技术人员将进一步隔离平台关键系统,减少不同服务之间的共同依赖,同时统一设置服务间的重试次数上限和超时机制,避免系统异常时大量客户端或服务自动重复请求进一步增加负载,最终形成连锁故障。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
长芯博创2026年上半年归母净利润3.21亿元,同比增长91.08%
上一篇 3小时前
开源鸿蒙 OpenHarmony 7.0 Release 版本发布,新增展锐 P7885 开发板支持
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部