🌀 AIBB-Flywheel

新闻数据飞轮
← 返回文章列表
ithome 国际 采集 2026-08-21T16:12:11+00:00

GitHub公布大规模宕机原因

原始标题:GitHub 通报 8 月 17 日大规模宕机事件原因:基础设施容量未能跟上平台使用量的快速增长

来源
ithome
发布时间
2026-08-21T12:20:56
采集批次
2026-08-21-16
字数
730
URL 指纹
d03cef0a2a25bcff

📌 AI 总结(148 字)

GitHub公布8月17日大规模服务中断调查结果:平台流量创历史新高后,美国中部数据中心关键基础设施容量不足,压力扩散至身份验证、Actions、API等服务;恢复期间,客户端重试又加剧流量,使故障持续7小时47分钟。GitHub表示将加强系统隔离,并统一重试上限和超时机制,以降低连锁故障风险。
📄 正文(730 字)
GitHub公布8月17日平台大规模宕机事件的调查结果,确认事故并非由程序代码或配置变更引起,而是基础设施容量未能跟上平台使用量的快速增长。

事故发生当日,GitHub平台流量创下历史新高,美国中部数据中心的一项关键基础设施组件容量不足,压力随后扩散至其他系统,导致身份验证失败,以及GitHub Actions、API、Pull Request、Issues等多项服务异常。

在恢复过程中,部分服务错误触发客户端重试机制,进一步增加系统流量,使技术人员花费较长时间才完全恢复服务。此次事故共计造成GitHub网站、身份验证、Actions、API、Pull Request、Issues等多项服务中断7小时47分钟。

GitHub表示,这已经是当月第二起重大服务事故。此前,GitHub Actions于8月6日发生服务故障。两起事故的核心问题均为基础设施容量不足,而非程序代码或配置变更。

近年来,GitHub平台使用量增长迅速。今年4月至今,每月提交次数已从14亿次增加至29亿次,合并Pull Request及新建代码仓库的数量也在持续增长。

为应对使用量增长,GitHub今年已增加超过300万个CPU核心、120PB高速存储空间及网络容量,并加快将工作负载迁移至微软Azure。目前约58%的GitHub平台负载已由Azure承载,高于今年5月的12%;约一半的Git操作也由Azure处理。尽管如此,平台仍出现因用户量快速增长而导致服务容量不足的情况。

GitHub表示,接下来将进一步加强关键系统隔离,减少不同服务之间的共同依赖,同时统一设置服务间重试次数上限和超时机制,避免系统异常时客户端或服务反复请求、增加负载并引发连锁故障。