IT之家8月21日消息,GitHub公布8月17日平台大规模宕机的调查结果,确认事故并非程序代码或配置变更引起,而是基础设施容量未能跟上平台使用量的快速增长。
此次宕机造成GitHub网站、身份验证、Actions、API、Pull Request、Issues等服务中断7小时47分钟。GitHub称当日流量创历史新高,导致美国中部数据中心关键组件容量不足,压力扩散至其他系统。恢复时部分服务错误触发客户端重试,进一步增加负载。
这已是本月第二起重大事故,8月6日Actions曾发生故障,两起均源于基础设施容量不足。今年4月至今,每月提交次数从14亿增至29亿。GitHub已增加超300万个CPU核心、120PB存储,并将约58%负载迁移至Azure。接下来将隔离关键系统、统一设置重试上限和超时机制,避免连锁故障。
