要約
- DigitalOceanは8月19日11時10分UTC、
MKC1の複数ラックとノードに及ぶ重大障害を公表し、GPU、DOKS、接続性の復旧を進めた。 - 19時34分に公開障害を解決済みとした時点で、リージョン制御プレーンと一般サービスは正常だったが、GPU Dropletsへの影響と全ノードの復旧作業は残っていた。
クラウド障害の終了時刻は、何を終了対象にするかで変わる。DigitalOceanが8月19日に公開したMKC1の記録では、リージョンの共通基盤が正常に戻った時刻と、GPUを載せた顧客資源の復旧完了時刻が明確に分かれた。後者の正確な時刻は公開されていない。
最初の通知は11時10分06秒UTCだった。カンザスシティーの複数ラックとノードに問題が発生し、GPUワークロードが中断する可能性と、DigitalOcean Kubernetes(DOKS)のワーカーノードがNotReadyになる可能性が示された。影響区分はcriticalだった。
12時22分、同社は原因を特定し、修復措置を実施中だと発表した。ただし、原因の中身は明かしていない。この時点ではGPUワークロードとServerless Inferenceに加え、DOKSワーカー、Kubernetes APIエンドポイント、影響を受けたクラスターの管理操作も影響範囲に入った。15時28分の更新では、接続を戻し、影響ノードをオンラインにする作業が続いていた。ラック数、ノード数、クラスター数、顧客数はいずれも示されなかった。
18時59分になると、回復した層が具体的に列挙された。リージョン制御プレーンは完全に健全で、CPU Droplets、Managed Databases、Load Balancers、Block Storage、Spacesは通常稼働。Dropletの作成、サイズ変更などの管理操作も利用でき、DOKSの制御プレーンにも到達できた。共通サービスの回復としては重要な節目である。
同じ更新は、未回復の層も切り分けた。MKC1のGPU Dropletsはオフラインまたは到達不能のままで、DOKSのGPUワーカーノードはNotReadyが続く可能性があり、GPUを使う推論エンドポイントも利用できない可能性があった。DigitalOceanは制御プレーンを短時間監視した後に公開障害を解決扱いとし、GPU顧客にはステータスページの代わりにSlackとメールで個別連絡するとした。
19時34分54秒、予定通り状態はresolvedになった。最終文はリージョン制御プレーンやCPU系サービスの正常化を再確認する一方、GPU Dropletsは引き続き影響を受け、全ノードの復旧を続けているとも記した。したがって8時間24分48秒という公開窓は、対象範囲が変化したインシデント管理時間である。全製品が同じ長さだけ停止した証拠でも、すべてのGPU負荷が最後に一斉復旧した証拠でもない。
MKC1は稼働開始から15日しか経っていなかった。DigitalOceanは8月4日、カンザスシティーを全面液冷でNVIDIA B300 GPUを運用する新リージョンとして発表した。Droplets、DOKS、データベース、ストレージ、ネットワーク、App Platform、Functionsなどを同時に掲げた。今回の資料から、液冷やB300が原因だったとはいえない。確認できるのは、GPUを商品面の中心に据えた新リージョンが、立ち上げ直後に復旧能力を公に試される事態となったことだ。
DOKSの構造は、層の違いを具体化する。Kubernetesの制御プレーンはDigitalOceanが管理し、顧客アプリケーションはワーカーノードで動く。制御プレーンへの到達が戻ればクラスターを操作できるが、NotReadyのワーカーにあるGPU能力まで復活するわけではない。同社はワーカーを自動交換する機能も文書化しているものの、これは公開プレビューでオプトインだ。条件、猶予時間、動作、同時実行上限の設定が必要であり、影響顧客が利用していたという証拠はない。
公開情報には埋まっていない欄も多い。原因を特定したとの説明や施設との共同作業という表現だけでは、電源、冷却、ネットワーク、ハードウェア、ソフトウェアのどれが原因か判断できない。GPUの完全復旧時刻、顧客数、データ損失やワークロード整合性の評価、再発防止策もない。後にコンポーネント表示が緑になったことは、過去の顧客負荷の復旧時刻を証明しない。
利用者が見るべきなのは一つの色ではなく、制御プレーン到達性、ワーカーのReady状態、GPU割り当て、推論エンドポイント、アプリケーション目標の組み合わせである。8月19日の記録では、それぞれの信号が別々に戻った。リージョン全体は公開終了の条件を満たしたが、GPU資源の回復は個別顧客向けの別工程として残った。
出典
- https://status.digitalocean.com/incidents/qd8v4wddyqjr
- https://status.digitalocean.com/api/v2/incidents/qd8v4wddyqjr.json
- https://ideas.digitalocean.com/changelog/now-available-kansas-city-data-center
- https://docs.digitalocean.com/platform/regional-availability/
- https://docs.digitalocean.com/platform/
- https://docs.digitalocean.com/products/kubernetes/details/managed/
- https://docs.digitalocean.com/products/kubernetes/how-to/configure-automatic-node-remediation/
- https://docs.digitalocean.com/products/kubernetes/details/availability/
会員向け解説
プロフィールの詳細
適切な会員レベルでログインすると、解説全文と出典メモをご覧いただけます。
Strategic Circle 限定
Strategic Circle
すべての読者に公開されています。参加してログインすると プロフィール解説 を閲覧できます。
Strategic Circle に参加Leadership Alliance 会員限定
Leadership Alliance
対象となる IP 資産の所有者・管理者向けです。ログインすると Leadership Alliance の解説を閲覧できます。
Leadership Alliance に参加

