• AWS 表示,冲突导致基础设施受损后,仅托管在巴林区域或阿联酋一个受影响可用区的部分资源无法恢复
  • 巴林的损坏波及多个可用区;当该区域整体不可用时,客户没有区域内恢复路径

事实

Amazon Web Services 于 9 月 15 日表示,对于仅托管在其中东(巴林)区域或阿拉伯联合酋长国一个受影响可用区的部分资源和数据,无法恢复访问。在巴林,AWS 表示,物理损坏波及多个可用区,超出了其区域级服务和多可用区服务在设计上能够承受的范围。此前发生损坏后,该公司曾建议客户迁移关键工作负载;大多数客户已在 4 月另一次中断导致该区域不可用之前完成迁移。

在阿联酋,仅存于受影响可用区的资源和数据仍无法访问,而该区域其他部分的恢复工作仍在继续。AWS 表示,大多数受影响客户已利用备份或受损基础设施之外可用的资源恢复运营。该公司计划在未来几个月进一步通报阿联酋的恢复情况,并于 2027 年初更新巴林的恢复进展。

评估

巴林中断事件显示了单个云区域内部冗余的边界。将应用分布在多个可用区可以抵御许多局部故障,但当损坏影响多个可用区、区域本身也变得不可用时,这种设计并不能提供恢复路径。

若工作负载必须能够承受此类故障,就需要在中断发生前在其他位置保有可用副本。备用区域不仅需要预留计算能力;数据、凭证、网络配置和其他依赖项也必须可用并经过测试,应用才能重新启动。

对 BTW 读者而言,实际需要区分的是区域内冗余与区域外恢复。采用多可用区设计,并不能说明工作负载能否承受区域级失效;这取决于已经在其他位置复制、备份和测试了哪些内容。

后续关注

关注 AWS 下一次关于巴林和阿联酋的更新,以了解区域服务的恢复进展。客户事后报告中有关恢复时间、区域外副本以及导致故障切换延迟的依赖项的信息,将提供最清晰的证据,说明不同韧性设计在整个区域不可用时表现如何。