• Cloudflare R2 では、9月4日21時10分(UTC)から9月5日未明まで、北米東部で503エラーが通常より多く発生した
  • R2 に依存するアプリケーションでは、障害が1つの製品と地域に限られていても、ストレージエラーがユーザーに表示される可能性がある

事実関係

Cloudflare は、北米東部で発生した R2 のオブジェクトストレージ障害について、9月5日00時42分(UTC)に解消済みとした。障害は9月4日21時10分(UTC)に始まり、この地域の顧客では HTTP 503エラーが通常より多く発生した。Cloudflare のステータス履歴によると、エンジニアは原因を特定し、修正を実施したうえで、サービスを監視してから障害対応を終了した。

この障害は、世界全体に及ぶ Cloudflare の障害ではなく、北米東部の R2 に関するものとして報告された。R2 は、ファイル、アセット、その他のアプリケーションデータの保存に使われる Cloudflare のオブジェクトストレージサービスである。そのため、影響を受けたサービスを通じて保存されたオブジェクトに依存するアプリケーションは、そのストレージへのアクセスが妨げられると、ユーザーにエラーを返す可能性がある。

分析

障害の範囲は、製品と地域を特定して説明できる程度に限られていたが、その R2 サービスを利用するアプリケーションは、保存データを取得しようとした際に処理が失敗する可能性があった。アプリケーション担当チームにとって重要なのは、障害がどこで起きたかである。R2 の503エラーは、ストレージへのリクエストを完了できなかったことを示すのであり、Cloudflare のプラットフォーム全体が利用不能だったことの証拠ではない。

診断の次の段階は、影響を受けた地域でアプリケーションのどの部分が R2 に依存しているかを把握することにかかっている。重要な機能にそれらのオブジェクトを必要とするサービスでは、障害の影響が直ちに現れる可能性がある一方、別のサービスはコンテンツの一部だけが利用できない状態でも稼働を続ける場合がある。

提供された報道は、顧客単位のダウンタイムやデータ損失を裏付けていないため、影響を Cloudflare が報告したエラー増加の範囲を超えて拡大解釈すべきではない。したがって BTW の読者にとって、耐障害性に関する判断はワークロード単位で行う必要がある。チームは、その依存関係にどの程度の保護が必要かを決める前に、どのアプリケーション機能がストレージサービスに依存しているかを把握する必要がある。

今後の注目点

Cloudflare が障害後の説明を公表するか、また北米東部で R2 の障害がさらに発生するかを注視する。原因と復旧に関する詳しい情報があれば、障害の範囲と、同じ地域での発生パターンが繰り返されているかどうかが明確になる。Cloudflare が示した解消時刻後もアクセス問題が続いたとの顧客報告があれば、復旧が同社のステータス更新後まで及んだかどうかを判断する手掛かりにもなる。