要点

  • ChatGPT 画像生成の障害は7月21日10:36:02 UTC に始まり、22日02:50 UTC に解決となった。
  • 状態は対策実施後に再び調査へ戻り、改善がすぐには安定しなかった。
  • API 画像生成の別障害は19:33:27 UTC に始まり、20:26に緩和、22:19に解決した。
  • 二つの時間が重なっても、同じ技術原因だったことは証明されない。
  • 原因、影響リクエスト数、地域、データ損失、サービスクレジットは公表されていない。

利用者がステータスページを見る目的は、原因を知ることだけではない。止めた処理をいつ再開するか決めるためでもある。今回の長い ChatGPT 障害では、一度の緩和表示を再開条件にすると早すぎた。

状態の逆戻りが運用コストを増やす

公開時刻では、障害は約16時間14分続いた。その間に対策が示され、再び調査となった。これは、全ての経路と全利用者が同じ挙動だったことを意味しないが、復旧判断が一度で確定しなかったことを示す。

緩和は通常、影響を減らす変更が入った状態である。滞留したジョブが消化され、全ての経路が正常で、再発しないという保証ではない。顧客は少数の合成リクエストを間隔を空けて送り、安定した成功を見てからキューを開放すべきだ。

解決表示にも範囲がある。OpenAI が02:50に対象コンポーネントの回復を確認したとしても、過去に失敗した生成が自動で再実行されたとは限らない。

API 障害を長い記録に吸収してはいけない

API のエラー増加は19:33:27に始まり、20:26に緩和、22:19に終了した。長い ChatGPT 障害と一部が同時だが、開始と終了、更新系列が異なる。

共通基盤が原因なら複数経路に影響することはある。一方、インターフェース、ゲートウェイ、キュー、モデル容量が別々に失敗することもある。原因説明がない以上、重なりを一つのバックエンド障害と断定できない。

利用者側の報告も経路別にする必要がある。ChatGPT 利用者は長時間の問題を、API のみの利用者は後半の窓を測る。両方を使う組織では異なるエラーが重なった可能性がある。

公開情報から総損失は計算できない

OpenAI は、件数、エラー率、地域、契約層を示していない。データ損失も報告していない。利用不能があったことは確認できても、世界の利用者全員の損失額や範囲は決められない。

画像が公開の必須素材なら、失敗は再送、重複、承認遅延、監視要員を発生させる。別素材を持つ利用者は作業を続けられる。この差を埋めるデータはない。

顧客の仕組みは、受付、実行、受領、人の承認を別の状態として保存し、冪等キーで重複を防ぐ必要がある。ChatGPT と API を併用するなら、今回の二つの窓が異なるため、個別の正常性確認が必要になる。

二つの障害は終了した。残った教訓は架空の原因ではなく、状態の読み方である。ChatGPT は複数回の対策後に安定し、API には別のエラー期間があった。「緩和」を「完了」と同義にする運用は、再発時にキューと人員の負担を増やす。

Sources