• 9 月 4 日 21:10(UTC)至 9 月 5 日凌晨,Cloudflare R2 在北美东部返回的 503 错误数量上升
  • 即使事故仅限于一个产品和一个地区,依赖 R2 的应用也可能向用户显示存储错误

事实

Cloudflare 将北美东部的一起 R2 对象存储事故标记为已于 9 月 5 日 00:42(UTC)解决。该事故始于 9 月 4 日 21:10(UTC),当时该地区客户遇到的 HTTP 503 错误数量上升。Cloudflare 的状态历史记录显示,工程师确定了原因并实施修复,随后在结束该事故前监测了服务。

该事故被报告为北美东部的 R2 服务事故,而非 Cloudflare 的全球性中断。R2 是 Cloudflare 的对象存储服务,用于存放文件、资源和其他应用数据。因此,当对该存储的访问受到干扰时,依赖受影响服务中所存对象的应用可能会向用户返回错误。

评估

这起事故的影响范围有限,可按产品和地区界定,但使用该 R2 服务的应用在尝试检索已存储数据时仍可能失败。对应用团队而言,故障所在环节因此十分重要:R2 的 503 错误表明某个存储请求无法完成,并不能证明 Cloudflare 整个平台都不可用。

下一步诊断取决于是否清楚应用的哪些部分依赖受影响地区的 R2。如果某项服务的关键功能需要这些对象,事故影响可能会立即显现;另一项服务则可能继续运行,只是部分内容不可用。

现有报道未确认客户层面的停机或数据丢失,因此,不应把影响范围扩大到 Cloudflare 所报告的错误数量上升之外。对 BTW 读者而言,韧性决策应在工作负载层面作出。团队需要先明确哪些应用功能依赖该存储服务,再决定这一依赖需要多大程度的保障。

后续关注

关注 Cloudflare 是否发布事故后说明,以及北美东部是否再次发生 R2 事故。有关原因和恢复过程的更多细节将有助于明确故障边界,并判断相同的区域性模式是否反复出现。如果有客户报告称访问问题在 Cloudflare 公布的解决时间后仍在持续,也将有助于判断实际恢复是否晚于供应商状态更新所示的时间。