上周,AWS 发生大规模宕机,导致《堡垒之夜》和《Roblox》等大型游戏服务中断,并波及游戏行业之外的重要服务和程序,引发广泛混乱。如今,宕机原因已经确定:这场大规模故障源于一个软件漏洞。
DNS 管理系统中的连锁故障
正如亚马逊最初调查这场持续 15 小时的故障时所报道的那样,问题源自 AWS 的 DNS 管理系统 DynamoDB。据 PC Gamer 报道,故障具体出现在 DNS Enactor。它是 DynamoDB 的一个组件,会持续更新域名查询表,以便根据环境变化进行负载均衡。
漏洞发生时,DNS Enactor 开始延迟,并且“在多个 DNS 端点上更新时出现异常高的延迟,需要反复重试”。与此同时,DNS Planner 仍在持续生成新方案。在第一个 Enactor 延迟期间,第二个 DNS Enactor 开始执行这些方案。
第二个 Enactor 执行新方案后启动清理流程,删除所有早于刚刚执行方案的计划。与此同时,第一个 Enactor 终于追上进度,并覆盖了较新的方案;本应阻止这一操作的检查机制,也因严重延迟而失效。随后,第二个 Enactor 的清理流程删除了较旧的方案,而这份方案此时已经成为生效方案。
亚马逊工程师解释称:“随着该方案被删除,区域端点的所有 IP 地址也立即被移除。”生效方案遭到删除后,系统进入“不一致状态”,最终需要操作员手动介入才能修复。
多款游戏服务受到影响
亚马逊表示,这一连串漏洞最终导致了持续 15 小时的宕机。运营 Downdetector 的网络情报公司 Ookla 估计,这次事件是其记录中规模最大的宕机之一。
受影响的游戏服务包括《Roblox》《堡垒之夜》《Pokémon GO》《PlayStation Network》《火箭联盟》和《Wordle》,此外还有大量非游戏服务与平台同时中断。
相关内容
《堡垒之夜》2025 年惊悚夜活动包含全部皮肤、联动内容、武器以及全新地图。
常见问题
这次 AWS 宕机的原因是什么?
故障源于 DynamoDB 的 DNS Enactor 组件中的软件漏洞。多个 Enactor 之间的延迟、方案覆盖和清理流程相互叠加,最终删除了正在生效的方案。
哪些游戏服务受到这次宕机影响?
受影响的游戏服务包括《Roblox》《堡垒之夜》《Pokémon GO》《PlayStation Network》《火箭联盟》和《Wordle》。
