概況
- KDDI によると、2022年7月2日午前1時35分(JST)に通信障害が発生し、2022年7月4日午後3時に前週同時刻比でサービス利用が回復した。影響期間は日本全体で61時間25分と報告されている。[1][5][7]
- 発端となった中断ははるかに短時間だった。全国送信網ルータの保守作業中に、誤った経路設定が行われ、約15分間トラフィックが途絶した。設定はロールバックされたが、障害は収束しなかった。[1][5]
- 端末と通信機器が繰り返し位置登録要求を再送した。VoLTE ノードが混雑し、全国送信網全体の分散処理が他拠点の VoLTE ノードへ負荷を拡散し、再登録要求に伴う認証トラフィックがサブスクライバーデータベースへ集中した。[1][5][9]
- KDDI の推計では、非統合ベースで約2,278万人の音声利用者と少なくとも765万人のデータ利用者が影響を受けた。沖縄セルラーネットワークを含めると、音声は約2,316万人、データは少なくとも775万人と推定されている。これらはサービス影響の推計値であり、重複排除した人数ではない。[1][5][14]
- 11月の行政指導への対応では、誤った手順書を使用したこと、承認とロールバックの管理を見直す必要性、混雑制御の自動化が不十分であったこと、破損したバックアップ状態が再起動を悪化させたこと、サブスクライバーセッションの不整合が回復を複雑化させたことが示された。[8][9]
- 国会公開記録は、KDDI 発信の119発信数は通常より約63%低下し、110発信数は約45%低下した一方で、他の経路は通話を吸収したことを示している。[20] これは観測上の音量変化であり、全ての緊急通報試行が失敗したことを示すものではない。
- KDDI は条件付き・謝罪の返金を発表し、影響推計として約75億円の財務影響を示した。返金対象、サービス影響推計、加入者数、実在個人数はそれぞれ別の指標であり、混同してはならない。[1][11]
- 説明責任は誤設定の有無を特定することで終わるものではない。手順の保有管理、専門家レビュー、承認証跡、ロールバック時機、異常状態テスト、混雑観測、バックアップ整合性、サブスクライバー状態の復旧、サービス別復旧証明といった実効的な統制運用まで含む。
- KDDI は、手順統制強化、混雑対策、有効なフロー制御、トポロジ変更、回復自動化、品質ガバナンス、対外コミュニケーション改善など多面的な是正策を公表した。[9][10][15][17] 施策の公表は、該当障害クラスが全て除去されたという独立した証明ではなく、コミットメントあるいは実装主張の提示にすぎない。
- 後の日本の大規模障害時向け緊急ローミングは、主要障害時に代替経路を提供する。ただし、これは事業者自網の脆弱性を置き換えるものでも、単独で起きたこの事象の政策的帰責理由を示すものでもない。[22]
最初の説明責任の事実は時間軸のずれにある
KDDI の公表する時系列には、性質の異なる二つの時計がある。
1つ目は、初期のルーティング中断の経過である。全国送信網のルータ保守中に、誤った経路設定によりそのルータを経由するトラフィックの一部が停止した。KDDI はこの中断が約15分だったと説明している。設定はロールバックされた。[1][5]
2つ目は、顧客とサービスへの影響時間である。KDDI は通信障害開始を2022年7月2日土曜の午前1時35分、音声とデータの利用回復を7月4日月曜の午後3時としている。ここから61時間25分になる。7月5日には利用正規性の追加確認が行われたと報じている。[1][7]
これを「61時間の経路設定ミス」と呼ぶのは誤りだ。逆に「15分の障害」と呼ぶのも誤りである。
経路設定の誤りは起点であり、長時間化した本体は回復プロセスの問題だった。呼制御負荷、VoLTE ノード、加入者認証、状態不整合、破損したバックアップ資材、どのコンポーネントを隔離するかという運用判断が事故長期化の要因となった。ここでの区別は重要で、起点の責任と増幅側の責任は同一ではない。
オペレータは、誤った変更を短時間で収束できればよいとは限らない。変更が境界内で制御され、ロールバック条件が現実的で、下流系が一時的障害を吸収できる設計ならば、担当者1人の打鍵事故でも封じられる。逆に短時間障害が持続的異常へ変換されることもある。端末は再試行し、キューは増大し、データベースへ再照会が重なる。複製状態が分裂し、回復行為そのものが追加負荷となる。コンポーネントは異常状態で再起動し、同時に多数のアラームが鳴るため可観測性は低下する。
したがって説明責任の問いは、単に「誰が誤設定を入力したか?」ではない。
実際に問うべきは次のとおりである。
- 誰が作業を承認し、どの証拠に基づいたか?
- ロールバックの上限をどの影響モデルで定めたか?
- どの下流動作が事前に検証されていたか?
- ロールバック後もサービスが復旧しなかったことを示した計測は何だったか?
- どの責任者にノード分離と負荷遮断の権限があったか?
- 回復に使える既知良好状態はどこまで準備されていたか?
- どのサービス試験が復旧完了を定義していたか?
加害者優先の調査は、誤設定を最も近い作業者へと縮約しやすい。制御優先の調査は、作業設計、リスク承認、ネットワークの異常挙動設計、再開時期決定の制度を検証する。
KDDI 自身の規制対応報告も同方向を示している。手順書管理、専門家チェック、承認証拠、ロールバック基準、混雑設計、回復手順、品質ガバナンスを明示しているためだ。[9] オペレータの説明は、ネットワーク変更は1人の技術者の操作ではなく、組織の制御対象であることを支持している。
ルート変更がシグナリング連鎖へ発展した過程
モバイルサービスは、ユーザーが日常的に意識しない大量のシグナリングに依存している。
端末はまずネットワーク接続を確立し、到達可能なエリアを認識させなければならない。VoLTE 音声サービスでは、加入者登録とコール確立を担う制御機能が必要であり、データサービスでも加入者認証とセッション状態を前提にする。これらは端末、移動体網機能、VoLTE ノード、加入者データベース間の多数メッセージ交換で成立する。
通常条件では、このシグナリングは利用者体験のごく一部である。利用者が体感するのは通話・メッセージ・データ通信であり、見えない前提条件として、登録・認証・ポリシー・経路交換の一連が成功していることが必要だ。
KDDI の技術説明では、誤設定により位置登録要求が一部放棄され、その後端末と機器が再送を繰り返した。[1][5] 再送は短時間で急増し、Tama の VoLTE ノードが混雑し、全国送信網を通じた分散処理で他の VoLTE ノードにも圧力が波及した。[1][5]
次に加入者データベースが連鎖の中核になった。KDDI は、VoLTE ノードと移動体通信設備が認証のためデータベースを問合せるため、再試行が認証トラフィックを増大させたと説明している。障害は単に通話数の増加ではなく、未完了登録と再送が生む制御要求の増加であった。
この区別は、工学と説明責任の両面で重要である。
通常の容量設計は同時通話数や同時データセッション数、同時加入者数に着目する。異常状態設計は、取引途中でメッセージが失われ再送される大量端末時の系挙動を対象にする。後者は、ピーク時需要とは異なる負荷形状を作る。
再試行機構は本来は信頼性向上のための機能である。パケット欠落や一時停止に対して利用体験を守る。一方、全国規模では、再同期や境界不足の再試行が負荷増幅器になる。要求が失敗すると端末が再要求し、ネットワーク機能が再要求し、データベースへ認証要求が繰り返される。遅延応答はトランザクションを開いたままにし、増大するキューがさらにタイムアウトと再試行を生む。
こうして障害は複数の制御面を横断する。
- ルーティング制御:トラフィックが意図した経路へ到達するか。
- 再試行制御:期待応答が届かないとき、端末とシステムはどう反応するか。
- 入口制御:過負荷ノードが新規要求を安全に拒否・遅延・整形できるか。
- データベース保護:認証と加入者状態システムが反復需要を抑制できるか。
- 分散制御:負荷分散が障害を収束させるか、拡散させるか。
- 回復制御:対応者が過剰シグナリング源を特定し隔離できるか。
KDDI はデータベース混雑緩和のためフロー制御を適用したが、異常なシグナリングは継続した。結果として、継続的に不整合要求を出していた18台中6台の VoLTE ノードを分離した。[1][5]
この対応は難しい回復トレードオフを示す。特定ノードが異常負荷源なら除外は有効だが、同時に正規サービス処理力も減る。判断には確かなテレメトリと権限委譲が必要だ。ノードが下流混雑の被害者か負荷発生源か、あるいは両方かを即時に識別しなければならない。
公開記録は全てのパケット経路、タイマー、しきい値を示していない。ただし、ネットワークの異常状態挙動が決定的だったことは明らかである。障害は、送信ルーティング、シグナリング制御、音声機能、加入者状態の相互作用に起因していたため、ネットワークインフラ説明責任の対象となる。
ルートを戻しても回復にならない理由
ロールバックは失敗した変更への安全策と見なされることが多い。KDDI の事故はその前提の限界を示している。
設定を元へ戻せば、変更前の状態は復元されることがある。しかし、その間に生成された状態は自動的には消えない。
中断時、端末とシステムは不完全登録を経験し、再試行が生じた。キューとデータベース負荷が変化し、一部ノードが混雑。加入者セッション情報が不整合化した。KDDI の後続報告では、VoLTE ノードの一部が破損したバックアップを読み込み、異常状態で再起動し、結果として登録再試行が追加発生したとされる。[9]
このため、ロールバック後のネットワークは、変更前と同一のネットワークではない。
これは状態保持インフラの一般的な性質である。無状態の経路情報は速やかに復元できても、その経路に依存するサービスは以下を保持しうる。
- 未完了トランザクション
- 再試行タイマー
- 有効期限切れセッション
- 整合性の崩れたレプリカ
- 不完全な認証状態
- 汚染されたキュー
- キャッシュされた障害応答
- 過負荷処理
- 進行中の回復作業
変更計画は、設定のロールバックとサービス復旧を分けて定義すべきである。
設定ロールバック試験は旧バイトやコマンドが復元されたかを問う。サービスロールバック試験は、利用者が異常なく登録・認証・通話・データセッションを再開できるかを問う。状態ロールバック試験は、データベース、キュー、キャッシュ、ノードバックアップがサービスを支える十分な整合を持つかを問う。
これらの試験結果は、同時点で一致しない場合がある。
KDDI の公表した対策には、下流サービス混雑を考慮してロールバック猶予を見直す内容が含まれる。[9] これは意味ある制御変更であり、ロールバックを遅らせると可逆な状態変化が状態依存危機へ転じることを示す。
ただし、早いロールバック閾値のみでは不十分である。
運用側は、許容時間内にどのような蓄積が起こり得るかのモデルを持つ必要がある。何件の再登録再試行が生成されるのか。どのデータベースが先に飽和するのか。どの範囲を分離できるのか。分離時に残るサービスは何か。経路を戻した後、どれだけの端末が同時再試行するか。
回復計画のトリガーは、ルータ状態だけでなくサービス健全性に基づくべきである。
- 登録成功率の急減
- 未完了要求の増加
- VoLTE ノードのキュー深度
- 加入者 DB 応答時間
- 認証拒否率
- 地域またはノード別の再試行量
- コールセットアップおよび完了率
- データセッション確立率
- 緊急通報成功率
ロールバックは依然として必要であるが、前提はシステム全体と一致していなければならない。
全国規模のモバイルネットワークにおいて、「以前の経路へ戻った」は中間的な技術事実であり、復旧完了証明ではない。
手順書は実運用のコントロールプレーンの一部である
KDDI の11月報告は誤った作業手順の使用を認めた。手順文書管理、専門家レビュー、作業承認の改訂を述べている。[9]
これは一見すると管理的に見えるが、実運用では非常に具体的だ。
保守中に入力されたコマンドは、次の連鎖で生成される。
- 意図するネットワークの結果
- 設計または変更要求
- 手順テンプレート
- 機器固有の指示
- ピアまたは専門家レビュー
- 承認
- 予定調整
- 実行
- 検証
- ロールバック
誤った手順が選択されると、ルータへログインする前にプロダクションが露出する。したがって文書の保管と選定権は制御プレーンの一部である。
信頼できる手順管理は次に応答できるべきだ。
- どのテンプレートが権威ある版か
- 想定したネットワークモデルとソフトウェア版は何か
- 最終指示の作成者とレビュー担当は誰か
- 前回承認版から何が変更されたか
- 対象機器またはトポロジは何か
- 試験結果または実証結果が運用結果と一致したことを示す根拠は何か
- リスク分類と承認レベルは何か
- 次工程へ進む前に何を満たす必要があるか
- 手順停止またはロールバック手順は何か
重要なのは「証拠」である。
第二の目は儀式化し得る。レビュー担当が最終案だけを見て意図状態、トポロジ、差分、期待出力を確認しなければならない。承認者もチェックボックスだけを確認し、失敗時の影響を見ていなければ承認は儀式化する。
KDDI は、識者による手順確認の実施、確認証拠の保全、承認者の再確認を行う体制に改めたと述べている。また、手順管理システムの整備も説明している。[9]
このような対策は「何を防ぐか」で評価される。
管理システムは次を難しくする必要がある。
- 誤った機器種別向け手順の使用
- 旧版の実行
- 必須の専門家レビューの省略
- 未検証コマンド列の承認
- 承認後の指示変更で承認を無効化しない運用
- 想定出力と実際の不一致を放置した実行
- 実施内容の記録喪失
高影響通信作業には、実務的に検証可能な自動化層が必要である。意図された変更はトポロジとポリシー照合できること。構成差分を検査できること。ラボやデジタルツインで想定経路と異常経路を検証できること。変更前後のプローブを自動化し、命令が許可されたノードやプレフィックス数を超えないように上限制御することが重要である。
自動化は人的説明責任を消去しない。人が参照できる証拠を増やすだけである。
運用者は、どの自動制御を満たせばよいか、例外は誰が認可するか、観測状態と計画との差異が出た場合に何をするかを決定し続ける。構文だけの自動確認では、意味的に危険な経路を承認し得る。
KDDI の事例は、手順統治がインフラ統治であることを示している。手順はネットワーク隣接の書類ではなく、運用権限そのものの実行記述であった。
リスク分類は運用慣熟度ではなく影響範囲で決めるべき
定常業務でも、例外的リスクは発生する。
担当チームにとって既知作業でも、既知コマンドでも、計画保守時間内の作業でも、そのリスクは運用影響を必ずしも規定しない。
KDDI は、失敗時の損害規模に応じて作業リスク評価と承認レベルを改訂し、重要イベント周辺で特定作業を抑止する期間を拡大したと述べている。[9]
これは確率重視から結果重視への重要な転換である。
全国送信ルータのリスク分類は次を考慮すべきである。
- 通過サービスの種類と数
- 登録・認証への影響の有無
- 再試行の伝播特性
- 負荷分散が障害を拡散するかどうか
- 冗長経路の独立性
- 緊急通報依存
- MVNO や企業顧客依存
- 観測と分離の可否
- 状態が回復不能化するまでの時間
- 代替システムの検証済み性能
エラー発生確率が低く見積もられた作業でも、全国規模の共通障害を招くなら最高の承認・検証基準を適用すべきである。
分類は時間リスクも反映するべきだ。トラフィックが少ない時間帯に設定した保守窓は、シグナリングリスクを最小化しない場合がある。多くの端末は、利用者の通話が少なくても障害時に同時再試行するためだ。呼量が少ない時間帯は、登録増大の観点では静かな時間とは限らない。
また、イベント抑止カレンダーは一要素にすぎない。大規模事象や悪天候、選挙は障害影響を増幅し得るが、通常の夜間でも緊急通報、物流、接続機器、輸送監視、重要業務は残る。
より強い統制は、明示された被害半径の予算設定である。
作業開始前に、運用者は次を明示すべきだ。
- 最大影響ノード数
- 最大影響地理範囲
- 最大サービス中断量
- 最大登録失敗率
- 最大ロールバック時間
- 最大下流回復時間
- 即時隔離が必要となる条件
- 作業中に利用可能な代替容量
観測指標はリアルタイムで予算と比較すべきだ。どれかを超えた場合、作業継続は新たな権限決定を要し、初期承認の自動継続とみなしてはならない。
このアプローチは「ルーティン保守」を境界付き実験へ変える。利用者は手順の慣れを見ない。見ているのはネットワークが実際に機能するかどうかである。
障害が生む状態を前提に混雑制御を検証すべき
KDDI 報告では、異常条件下で自動混雑制御が十分機能しなかったことを明らかにしている。後続的にフロー制御を有効化または改訂し、検知ツールを詳細化し、VoLTE トラフィックと緩衝設計を変更した。[9][10]
混雑制御は通常時のピークトラフィックだけでは評価できない。
通常のピークには、妥当な要求が想定の分布とタイミングで到来する。障害時は、繰り返される不完全・相関付き要求が生成される。経路の半分だけ到達して応答が失われる場合がある。全国分散が通常均等にならさないよう特定コンポーネントに集中する場合がある。複数のネットワーク機能が同じ加入者 DB へ再試行を重ねることがある。
したがって、検証は失敗時の意味を含める必要がある。
- 部分的経路喪失
- 非対称到達性
- 応答遅延
- 重複要求
- 同期した端末再試行
- 二系統うち一系統停止
- データベース遅延と不整合
- 高負荷下でのノード再起動
- 監視喪失
- 回復ツールの競合
目的は漸進的劣化(グレースフルデグラデーション)である。
ネットワークがすべての要求を処理できない場合、重要制御を優先的に保護し、回復に必要な容量を残すべきだ。早期に要求を拒否し、バックオフを適用し、地域分離し、緊急サービスを優先し、障害ドメインを隔離することも必要になる。
KDDI は、VoLTE の構成を全国フルメッシュから東西分離設計へ変更し、フロー制御機能を有効にした。これにより、混雑拡散の機会を下げることを狙ったと報告している。[9]
原則は「障害封じ込め」である。
分散は独立容量を生む場合は回復性を高める。逆に全ノードが同一障害に関与するなら回復性は低下する。フルメッシュは正常時の経路は豊富だが、異常時シグナリングを国内規模で拡散させる可能性がある。地域分離は柔軟性を一部失う代わりに共通失敗領域を小さくできる。
公開記録は現在のトポロジ全体や全試験結果を立証していないが、検証可能な改善質問を提示している。
同種の部分経路障害が再発した場合、混雑制御限界が作動するまでに、どれだけのノード・地域・加入者が影響を受けるか。
妥当な回答には検証条件、観測閾値、拒否挙動、緊急サービス性能、影響領域分離までの最大時間が含まれる必要がある。
「構成を変更した」表現だけでは設計上の記述にとどまる。観測値が添えられれば、運用改善策は回復制御となる。
バックアップ整合性と加入者状態は障害設計に組み込むべき
バックアップは、サイバーセキュリティやデータ消失対策の文脈で語られることが多い。KDDI の報告は、可用性維持における役割も示した。
11月報告は、複数の VoLTE ノードが破損したバックアップを読み込んで異常状態で起動したことを示す。加えて、加入者データベースのセッション不整合についても言及している。[9]
これにより、回復時の状態起源が中核となる。
ネットワークノードは単に再起動したから回復したことにはならない。再起動時に読み込むソフトウェア、設定、運用状態が既知良好で、かつ他システムと互換が取れている必要がある。
信頼できる回復プロセスは次を確立する必要がある。
- バックアップ作成時刻
- 含まれるソフトウェア版と設定版
- 混雑または部分障害中に作成されたか
- 完全性検査の実施有無
- 同一ノード群や加入者状態との整合
- 利用許可者
- 負荷後のサービス試験合否
障害中に自動作成されたバックアップは、障害そのものを保持している可能性がある。
ノードが異常状態で保存し、その状態から次の復旧イメージを作成すると、再起動で障害を再生する。加入者データベースが分岐すれば、1つのコピー復元がセッションを無効化し、再登録を拡大する。運用者がどの状態を正当とするか判断できなければ、すべての補修行為が新たなリスクを生む。
解は自動バックアップの排除ではない。操作状態と独立して検証済みの回復点を区別することにある。
重要ネットワーク機能は、次を持つべきである。
- 変更不能または書き込み制限付きの既知良好設定
- 署名付きソフトウェア・設定マニフェスト
- 複製状態の整合性検査
- 異常時に生成されたバックアップの隔離
- 検証済みのリセット手順
- クリーンな管理経路
- 段階的再起動とサービスプローブ
- 回復アクション側からの明示的ロールバック
KDDI はノードリセット手順の改訂と複数 VoLTE ノードの混雑検知・解消ツール整備を公表している。[9] これらは回復速度を改善する施策であるが、状態整合性を同時に担保することを示す証拠も必要だ。
モバイル運用者にとって、設定、加入者状態、復旧権限はいずれも可用性資産である。ストレス時に信頼できないバックアップは回復力資産とはならない。
影響数値は区分して読むべき
大規模障害は多数の大きな数値を生むが、それぞれが異なる問いに応える。
KDDI は、非統合ベースで約2,278万人の音声利用者と少なくとも765万人のデータ利用者が影響を受けたと推定している。沖縄セルラーネットワークを含めると、音声は約2,316万人、データは少なくとも775万人である。KDDI は、音声とデータの推定方法は比較期間の通話差分・登録差分と異なることを説明している。[1][5][14]
これらを加算して3,000万人超の一意利用者を主張すべきではない。
1人が音声とデータの両方を使うことはありうる。1アカウントが複数回線を持つこともある。登録差分を用いたデータ推計は、試行失敗者数と同一ではない。"影響"には断続的な品質劣化や利用不可の様々な状態が含まれる。
返金数値は別の問いである。
KDDI は、2.71百万人の KDDI 顧客と70,000人の沖縄セルラーネットワーク顧客が条件を満たしてサービス別返金対象となったと公表。さらに、KDDI の35.89百万人および沖縄セルラーネットワーク66万人に200円の謝罪返金を実施したとする。[1]
これらは契約・方針上の判断であり、同時時点での実利用障害を直接示す技術指標ではない。
KDDI が開示した約75億円の経済的影響も別次元である。[11] 会社の会計と返金前提の下での事業影響であり、全取引損失や遅延配達、接続機器停止、利用者時間損失を網羅するものではない。
妥当なインパクト把握は4つの次元を分離する。
- サービス影響:どの機能が利用不能または劣化したか
- 観測利用:通話、登録、取引の通常時比較
- 利用者救済:どのアカウントがどの返金に該当したか
- 経済的結果:事業者の直接コストと広い社会的損失
数値を誇張すれば分析は弱体化する。堅固な結論に誇張は不要である。
本件は全国規模で長期化し、重要なモバイルサービスと依存先システムへの中核的制御障害に起因した。正確な測定は結論を誇張しないことで、より信頼性を高める。
緊急通報は可用性を公共責務に変える
モバイル障害は、利用者が緊急サービスに継続的に到達できない場合、公共安全事件となる。
公開される国会速記は具体的である。KDDI 発信の119通話は障害中に約63%減少し、非 KDDI 携帯や他経路で補完が増えた。110についても KDDI 発信は約45%減少し、他社や公衆電話の受け皿が増えた。[20]
これらは発信元経路ごとの観測変化を示すものであり、全通話意図・端末エラーメッセージ・代替接続の成立可否・各緊急性の結果を示してはいない。
それでも依存関係を示している。
全国モバイル網が停止すると、緊急需要は消滅しない。別回線へ切り替える、固定電話を使う、主的な公衆電話を利用する。代替がない利用者もいる。代替網の負荷や受電センター負荷は二次リスクとなり得る。
したがって、緊急通報継続性は、一般音声可用性を超えた証拠が必要になる。
- 110、118、119へのコールセットアップ
- 発信者位置の取り扱い
- 折り返し呼の可否
- 優先順位と混雑処理
- MVNO からの利用可否
- 障害時のアクセシビリティ
- 地域別性能
- 主ネットワーク停止時の利用者向け案内
- 代替ネットワークへの負荷移転
KDDI の対応は、緊急通報組織との情報共有強化と代替通信・他事業者ローミング作業への関与を示している。[9][10]
これらは異なる問題に対応する。
情報通知の改善は当局と利用者が障害を理解する助けになる。代替経路は別事業者ネットワークへ発呼させる。いずれも、KDDI 自身の緊急通報経路の堅牢性責任を代替しない。
公開された説明責任基準は、影響が大きいほど厳格であるべきだ。事業者は商用音声復旧を報じても、緊急呼の位置情報・折返し・混雑がなお残ることがあり得る。したがってサービス行列では、緊急機能を単一の音声指標に埋め込まず分離して評価すべきだ。
実務上の統制は分散していたが均一ではない
ネットワーク障害には多くの関係者が関わる。説明責任は、誰が実際に防止・検知・限定・開示・復旧を行えるかに基づく。
KDDI
KDDI は、保守プロセス、手順保有、作業承認、経路設定、ロールバック基準、監視、VoLTE ノード運用、加入者データベース回復、サービス測定、顧客コミュニケーション、規制当局向け提出証拠を統括した。
これは、KDDI がすべての製品挙動を統制したこと、またはすべての故障を防げたことを意味しない。事実として、運用環境と回復に対する最も広い実務権限を KDDI が保有していたことを意味する。
機器・ソフトウェア供給者
供給者はノードソフト、DB 挙動、再試行特性、高負荷文書、バックアップ形式、技術支援を保有し得る。KDDI の報告は、供給者情報を取得し、高負荷試験を実施したことを示す。[9]
公開記録は供給者構成、契約、欠陥検知結果の全体を示していない。特定ベンダーを名指しで非難することは無責任である。必要なのは、KDDI がどの供給者証拠を必要とし、製品が想定外挙動をした場合にサービス保護を担保する権限を持つこと。
総務省と審査機関
総務省は重大事故報告を受領し、行政指導を発し、事故検証と業界事故問題を検討するレビュー体制を運用した。[3][8][9][21]
規制当局の権限は証拠要求、報告基準設定、業界回復規則の育成にある。KDDI のルータ直接運用や加入者状態回復を実施しない。
緊急サービス、MVNO、企業顧客
これらの主体は依存・影響の根拠を保持する。MVNO は添付顧客の登録や通話不能を観測できる。企業顧客は接続機器や物流機能の障害を報告できる。緊急組織は通話量と位置情報の変化を計測できる。
しかし、失敗した KDDI 中核を制御していないため、これらは優先順位や継続性は高められるが、一次的インフラ責任を移譲しない。
利用者
利用者は実務的に代替連絡手段を準備できることがあるが、多くは全国モバイルを重複複製する経済的余力がない。公衆電話、Wi-Fi、第二事業者端末、固定回線は一部を緩和するが、体系的な中核障害への十分な代替とはならない。
この配分は二つの誤りを避ける。
第一に、近接した個人やコンポーネントへの責任帰着だけで説明しようとする誤り。第二に、責任を過度に拡散し、いずれの主体も実効責任を持たない状態にする誤り。
KDDI には、短時間の起点が長期全国障害へどう拡張したか、同様の連鎖をどのように封じるかを示す最も重い説明責任がある。
是正は連結した証拠パッケージとして検証すべき
KDDI は大規模な是正プログラムを公表した。11月報告と後続開示は次を示している。
- 手順文書管理の強化
- 確認済みの専門家レビュー
- 改訂された承認方式
- 明確なサービス正常性基準
- 混雑を考慮したロールバック時間
- 影響ベースの作業リスク分類
- 作業抑止ルールの拡大
- 詳細な混雑検知ツール
- 通信経路とトポロジの変更
- 有効なフロー制御
- 他モバイルシステムでの類似障害モード検査
- リセットと回復手順の改定
- 多数ノード混雑解消ツール
- 品質ガバナンス変更
- 大規模演習
- 公開・関係者コミュニケーション改善 [9][10][15][17]
これは有意義なリストであるが、列挙自体を根拠と誤読してはならない。
制御は相互作用する。一方の強化が同様の命令エラーを防げても、別の意味論的変更には効かないことがある。フロー制御は VoLTE ノードを守っても、再試行特性の近い別システムには限界がある。地域分離は拡散抑止できても、共有データベースや管理権限が同一なら限界が生じる。回復ツールが速くても、同じ検証されていない状態を再利用すると負荷を増やす。
是正パッケージは、観測された各障害を制御と検証と対応づけるべきである。
| 観測された障害 | 是正制御 | 必要な証拠 |
|---|---|---|
| 誤手順の選択 | 版管理された手順保有と専門家レビュー | 期限切れ/誤機器向け手順の使用が阻止されること |
| リスクの過小評価 | 影響ベースの分類 | 全国・共通障害規模の作業が必要な承認・検証深度を満たすこと |
| 回復不適期のロールバック | サービス指向のロールバック閾値 | 再試行とデータベース上限を超える前にロールバックが実行されること |
| 部分経路障害で再試行が増加 | 異常状態を前提とした再試行・フロー制御 | 負荷試験で再試行が上限化され、重要機能が保護されること |
| 混雑拡散の全国化 | 地域障害ドメイン分離とトポロジ変更 | 注入試験で拡散が定義済み域または容量範囲内に留まること |
| 有害ノードの特定困難 | ノード別未完了要求テレメトリ | 定義時間内に発生源を同定できること |
| 劣化状態で回復を実施 | 検証済み回復点とリセット手順 | 段階的再起動が破損状態を除外し、整合性を維持すること |
| 加入者セッションの分岐 | データベース整合・調整制御 | 回復試験で権威状態と登録再試行の上限を示すこと |
| 公開情報不足 | インシデント情報テンプレートと専任体制 | 演習でサービス・緊急・回復情報を適時提供できること |
| 代替通信の限界 | 他事業者連携と独立代替経路 | 音声・データ・SMS・緊急の試験条件で有効性が示されること |
必要な証拠は運用中で有効でなければならない。
事故後に策定した方針だけでは運用反映を証明しない。あるバージョンのラボ試験だけでは後のトポロジを証明しない。教育受講記録は、曖昧なテレメトリ下でノード隔離できる運用力を保証しない。
有効な証拠例は以下のとおりである。
- 署名付き手順版
- 承認記録
- 設定・トポロジハッシュ
- 試験台帳
- 障害注入結果
- サービス別プローブ
- 回復時間測定
- 例外履歴
- 第三者レビュー
- 残存リスク判断
必要なのは、機密なコマンドやクレデンシャル、機微なトポロジを秘匿しつつ、失敗クラス、制御目的、試験範囲、保証結果を公開することだ。
全国事業者にとって持続的な改善は、規制当局、経営陣、技術部隊、重要顧客が理解できる形で再現可能でなければならず、担当者や供給者が交代しても意味が維持されることが必要である。
「復旧」とはサービス別の判定表で示す
KDDI は、7月4日15時の前週同時点比較を回復確認の一要件としている。[1][7]
これは有効だが不十分である。
総合トラフィックが戻っていても重要取引はなお障害になることがある。データ量が平常化して見えていても、一部端末が登録できない場合がある。音声分で分単位を満たしていても、地域で通話セットアップが失敗し、緊急コールバックが影響を受けることがある。
全国モバイルの復旧行列は次のように構成すべきだ。
| 領域 | 最低証拠要件 |
|---|---|
| 端末登録 | 地域別・端末種別・ネットワーク世代別に、attach と位置更新成功率を示す |
| VoLTE 音声 | コールセットアップ、完了、着信到達、ハンドオーバー、エラー率 |
| 緊急通報 | 110・118・119のセットアップ、位置、折返し、混雑処理 |
| モバイルデータ | 認証、セッション作成、DNS、公開/専用到達性 |
| SMS | 提出、待ちキュー、配信、失敗理由 |
| 加入者データベース | 遅延、整合、セッション再調整、レプリカ健全性 |
| MVNO サービス | attach、音声、データ、SMS、サポート経路指標 |
| IoT・企業向け | 代表機器登録、テレメトリ、閉域ネットワーク到達性 |
| 相互接続・ローミング | 相手網経由の発着信とデータ取引の実績 |
| 顧客コミュニケーション | ステータスページ、サポート窓口、代替手順の理解可能性 |
各領域には機能基準と容量基準を持つ。
機能回復は代表トランザクションの成立を指し、容量回復は通常負荷を不安定なキューや再劣化なく処理できることを指す。安定回復は結果が持続することを意味する。是正は、発端障害の発生クラスが再現しないことを示すまで続く。
これらを同一時刻で同一評価してはならない。
独立観測も必要だ。監視基盤が復旧対象と同じサブスクライバーDB や管理面に依存していれば、見かけが偏る。外部プローブ、MVNO 測定、接続先事業者、緊急組織、サンプル利用者取引などは外部視点を提供する。
KDDI の現在のネットワーク品質記述では、全国条件が運用センターから集中監視され、容量・冗長・分散設備向け標準を用いているとされる。[19] 問題は、再発防止した特定障害クラスでこの一般制御がどのように効いたかである。
目標は、全ユーザーが問題解決を確認するまで待機し続けることではない。統計と実装の面で検証可能な境界を設けることである。
「ネットワークは復旧した」と公表されるなら、トラフィック増加だけでは意味を満たさない。重要機能が定義済み試験を通過し、容量が安定し、残存例外が可視化されることを意味する。
緊急ローミングは代替手段であり、免責ではない
2026年3月、日本の主要携帯各社は、主要災害時・停電時向けに全国的な緊急ローミングを発表した。サービスは、音声・限定データ・SMS を含むフルモードと、緊急通報限定モードを備える。[22]
これは後続の回復検証において関連性がある。
1事業者のネットワークが利用不能になった場合に、代替接続経路を提供する。このサービスは、1契約ユーザーが完全に孤立するリスクを下げる。あわせて、競争環境であっても個々の利用者が冗長接続を持つことが自動ではないという問題を示している。
このサービスには境界がある。
- 代替事業者のカバレッジと容量
- 端末側の対応要件
- データ速度の低下
- 緊急限定モードはアウトバウンド中心で、折返しは含まれない場合
- 起動には事前調整と周知が必要
- 災害は複数事業者へ同時波及する可能性
また、緊急ローミングは障害事業者の問題自体を修復しない。
したがって、次を弱める根拠にはならない。
- 内部手順統制
- 混雑防御
- 加入者状態回復
- 緊急サービス設計
- 復旧証明
- 一次障害に対する責任
公開記録は、2022年の KDDI 障害単独が2026年導入を直接生んだと結論づけていない。国会速記は、主要通信障害後の検討として、複数年にわたり事業者横断・政府関与の施策が進んだ経緯を示す。[20][22]
説明責任としての代替経路は、次の階層の一部として捉えるべきだ。
- 危険な変更を防ぐ
- 一次ネットワーク内で障害を封じる
- 信頼できる状態へ回復する
- 優先サービスを維持する
- 独立代替経路を提供する
- 制約を明確に案内する
代替手段の価値は、同時高負荷・高需要時に実際に試験されて機能する場合に高まる。
公開記録が確定できない点
ソースは詳細な統制分析を支えるが、完全な非公開の事後解析までは支えない。
確定できない点は次のとおりである。
- 実際の経路コマンド
- 影響を受けた全プレフィックスや経路
- 作業を実施した担当者の同定と意思決定
- 完全な承認連鎖
- 影響を受けた全ノード・DB のベンダーとバージョン
- 供給者欠陥の寄与有無
- 再試行タイマーと混雑閾値の全域
- 地域別サービス可用性の全体像
- すべての緊急通報試行結果
- 全 MVNO、ローミング、IoT、企業影響の完全版
- 正確な顧客損失数
- 現行の本番構成
- 全是正施策の独立有効性
これらの空白を推測で埋めることは適切ではない。
未解明事項は以下の証拠で検証可能である。
- 版管理された変更チケットと手順差分
- トポロジと経路ポリシーのシミュレーション
- ノード別シグナリングテレメトリ
- データベース整合性ログ
- バックアップハッシュと検証結果
- 供給者支援記録
- サービス別プローブ
- 障害注入レポート
- 規制当局の継続的保証
不確実性は説明責任を放棄する理由ではない。むしろ証拠要求を明確化する条件である。
再利用可能なモバイルネットワーク変更の説明責任テスト
この KDDI 事例は、高影響通信作業に対する実務的な基準を示す。
1. 意図を実行可能な変更と束ねる。
承認された成果、トポロジモデル、手順、対象機器、実設定差分を1つの版管理オブジェクトにする。
2. 専門家レビューを証拠化する。
レビュー担当は意図状態、異常経路、期待出力、ロールバック条件を確認し、コマンド一覧だけを読む運用を避ける。
3. 最大被害規模で分類する。
承認深度はサービス影響、地理影響、緊急依存、共通障害の広がりで決める。
4. 被害半径予算を設定する。
実行前に、最大影響ノード、地域、利用者、時間、下流状態の上限を定義する。
5. 部分障害を検証する。
要求の損失、非対称経路、再試行バースト、遅延応答、片系欠落を実施し、結果を検査する。
6. 制御信号とアイデンティティ系を保護する。
再試行・受け入れ・データベース需要に上限を設け、短時間障害が自己増幅化しないよう抑える。
7. 真の障害分離を設計する。
分散は独立容量を生む場合は回復性を高める。異常時に全ノードが同時に影響されるなら回復性は低下する。
8. ロールバックをサービス観点で設計する。
ロールバック基準には登録、通話、データ、データベース健全性を含め、経路状態のみでは評価しない。
9. 信頼できる状態を保持する。
ソフト、設定、重要な加入者復旧状態は独立検証された起点から供給する。
10. 対応者権限を明確化する。
ノード隔離、負荷制限、地域分離、代替経路起動の判断権限を事前定義する。
11. 復旧をトランザクション単位で定義する。
登録、音声、緊急、データ、SMS、MVNO、IoT、企業、ローミング、サポート機能を別々に測る。
12. 外部視点で観測する。
制御プレーンに依存しないプローブと提携先で確認する。
13. 障害クラスを再現試験する。
過去のコマンドではなく、失敗クラスの意味論的変種で検証する。
14. 是正を展開状態に拘束する。
方針と図は、現行構成、試験結果、例外、残存リスク判断に接続させる。
15. 有界な代替経路を維持する。
緊急ローミング、他事業者、固定通信、Wi-Fi、公衆電話は損害軽減要素だが、容量と制約の範囲と通信を明示して運用する。
16. 適切な説明可能性で公開する。
何が失敗し、どの統制領域が変わり、どのように試験され、何が依然として不確実かを、機密情報を守りつつ説明する。
この基準は、全国ネットワークが絶対に障害ゼロであることを要求しない。求めるのは、権限が被害範囲に見合い、復旧主張が検証可能であることだ。
結論
KDDI の2022年7月障害は、保守中の誤経路設定で開始した。設定は短時間でロールバックされた。しかし、ネットワーク状態の変化が障害長期化を招いた。
位置登録要求が再送され、VoLTE ノードが混雑し、加入者認証トラフィックが拡大し、加入者データベースは過負荷かつ不整合に。復旧時の一部状態は破損し、18ノード中6ノードが分離された。結果として、日本全国の音声・データサービスは報告上61時間25分影響を受けた。[1][5][9]
説明すべき教訓は、誤設定を行った個人の一人を特定することではない。
全国ネットワーク変更は制度としての統制連鎖であり、手順保有、専門家レビュー、承認、被害半径分析、ロールバック時機、異常状態設計、混雑可観測性、バックアップ整合性、回復権限、サービス測定が短時間を長時間化から守るかどうかを決める。
KDDI はこの連鎖全体に対する対策を公表しており、評価と再検証に値する。後の緊急ローミングは有効な代替経路を追加するが、リストは限定的であり、主要網に求められる一次責任を免除しない。
重要なモバイルインフラにおいて、旧経路に戻すだけでは不十分である。シグナリング系の安定、加入者状態の信頼性、重要通話成立、代替手段の実効性、そして次の高影響変更が同じ境界で見逃されないことまで示す必要がある。
これは、経路が既に戻ったあとでも、61時間という事態が示した説明責任の試験である。
情報源
- https://www.kddi.com/english/important-news/20220729_01/
- https://www.kddi.com/important-news/20220729_01/
- https://news.kddi.com/kddi/corporate/english/ir-news/2022/08/05/6189.html
- https://news.kddi.com/kddi/corporate/newsrelease/2022/07/29/6183.html
- https://www.kddi.com/extlib/files/english/corporate/ir/library/presentation/2023/pdf/kddi_220729_e_shougai_qe3B6V.pdf
- https://www.kddi.com/extlib/files/corporate/ir/library/presentation/2023/pdf/2023/220729-shougai.pdf
- https://www.notice.kddi.com/news/mainte/content/syougai/fre_00034454.html
- https://news.kddi.com/kddi/corporate/newsrelease/2022/11/02/6361.html
- https://news.kddi.com/kddi/corporate/newsrelease/2022/11/02/pdf/press_20221102.pdf
- https://news.kddi.com/kddi/corporate/english/ir-news/2022/11/02/pdf/kddi_221102_e_main_nQWHTi.pdf
- https://news.kddi.com/kddi/corporate/english/ir-news/2022/07/29/pdf/kddi_220729_e_statement_full_jOLDLZ.pdf
- https://www.kddi.com/english/corporate/ir/ir-library/sustainability-integrated-report/2022-online/
- https://www.kddi.com/extlib/files/english/corporate/ir/ir-library/sustainability-integrated-report/2022-online/pdf/kddi_sir2022_e06.pdf
- https://www.kddi.com/extlib/files/english/corporate/ir/ir-library/sustainability-integrated-report/pdf/kddi_sir2022_e_p.pdf
- https://www.kddi.com/extlib/files/english/corporate/ir/ir-library/sustainability-integrated-report/pdf/kddi_sir2023_e_p.pdf
- https://www.kddi.com/english/corporate/ir/ir-library/sustainability-integrated-report/2022-online/ceo_message_lookback/
- https://newsroom.kddi.com/news/detail/kddi_pr-907.html
- https://www.kddi.com/english/corporate/sustainability/governance/risk-management/
- https://www.kddi.com/english/corporate/sustainability/society/network/
- https://www.shugiin.go.jp/internet/itdb_kaigiroku.nsf/html/kaigiroku/009421020221027002.htm
- https://public-comment.e-gov.go.jp/pcm/download?seqNo=0000251103
- https://newsroom.kddi.com/english/news/detail/kddi_nr-958_4373.html
会員向け解説
プロフィールの詳細
適切な会員レベルでログインすると、解説全文と出典メモをご覧いただけます。
Strategic Circle 限定
Strategic Circle
すべての読者に公開されています。参加してログインすると プロフィール解説 を閲覧できます。
Strategic Circle に参加Leadership Alliance 会員限定
Leadership Alliance
対象となる IP 資産の所有者・管理者向けです。ログインすると Leadership Alliance の解説を閲覧できます。
Leadership Alliance に参加
