GitHub 公布 8 月 17 日大规模故障原因:流量峰值引发负载均衡器网络饱和
8 月 17 日,GitHub.com 出现持续约 7 小时 47 分钟的服务故障,Issues、Pull Requests、API、Actions 和 Copilot 等服务受到影响。故障高峰期间,GitHub 网页和 API 请求错误率约为 20%,仓库 Archive 与 Raw 内容下载错误率一度达到约 50%。
GitHub 在事故复盘中表示,直接原因是美国中部数据中心的负载均衡器发生网络饱和。一个 Istio Sidecar Pod 达到并发上限后未能正确自动扩容,问题随后级联扩散,最终导致 4 个 HAProxy 节点耗尽连接流量容量,并影响 GitHub 的网关认证路径。
恢复过程中,重试机制进一步放大了故障。GitHub 称,VS Code 中一个潜在的重试问题将部分请求流量放大约 10 倍,Copilot Token Service 的流量由正常的每秒 7,000 至 9,000 次请求升至 70,000 至 100,000 次,导致 Copilot 的认证服务恢复时间明显延长。GitHub 表示将调整 Istio 自动扩容策略、审查客户端与网关重试机制,并加强负载均衡容量监控与区域故障转移能力。
来源:GitHub Status 官方事故报告
https://www.githubstatus.com/incidents/zkxwbgr0cnmx
0 评论