要約
- 障害は2022年7月2日01時35分ごろ(日本標準時)、KDDIが多摩ネットワークセンターで全国中継網のコアルーターを保守していた際に始まった。誤った、または古い作業手順にVoLTEの経路切り替えが含まれておらず、応答が約2回に1回失われる断続的な状態から位置登録の再試行が急増した。
- 再試行負荷は分散配置されたVoLTE呼制御機能を通じて全国へ波及し、加入者データベースの輻輳と相互に増幅した。6台の呼制御ノードは内部の認証セッション状態が不整合なままバックアップを書き出し、そのバックアップから再起動したため、異常状態を確実には解消できなかった。
- 復旧には経路を戻す以上の対応が必要だった。接続要求とVoLTEトラフィックの流量制御、呼制御機能の再起動、PGWの切り離しとセッション初期化、加入者データベースの負荷分散、そして異常が残った6台のVoLTEノードの隔離が組み合わされた。
- 公的に示されたサービス影響時間は、7月2日01時35分から7月4日15時00分までの61時間25分である。一方、全通信ネットワークの正常運転が最終確認されたのは7月5日15時36分で、開始から約86時間後だった。両者は別々の運用上の時計であり、置き換えてはならない。
- 総務省は本件を重大な事故として検証し、手順管理、リスク評価、輻輳設計、高負荷時の再起動試験、複雑な復旧、訓練、利用者への情報提供に課題を認定した。KDDIによる返金と再発防止策は事業者側の対応であり、規制当局が科した金銭罰でも、裁判所による責任判断でもない。
一つの障害に二つの時計がある
KDDIは通信障害の開始を、2022年7月2日土曜日の01時35分ごろとしている。同社が後にまとめた説明では、影響時間の終点は7月4日月曜日の15時00分で、合計61時間25分だった。総務省の専用検証報告も同じ影響時間を採用している。
しかし、正常化の確認はそこで終わっていない。共同通信によれば、KDDIが全通信ネットワークの正常運転を確認したのは7月5日火曜日の15時36分で、障害開始から約86時間後だった。61時間25分は事業者と行政がサービス影響として整理した時間であり、約86時間は全ネットワークの運用確認までを含む時間である。長い方を正式な影響時間に読み替えるのも、短い方だけでその後の制限解除や安定性確認を消してしまうのも正確ではない。
二つの時計の間には、流量制限の解除、音声通話成功率の観察、ネットワーク安定性の確認、整合しない状態の修正、通常需要を安全に収容できるという判断がある。経路修正や機器再起動が完了しても、利用者が通話できるとは限らない。「復旧」という一語にすべてを押し込むと、どの条件を満たしたのかが見えなくなる。
影響人数も、発表主体と集計時点を保ったまま扱う必要がある。総務省の検証報告は、音声で約2,316万人、データで少なくとも775万人が影響を受けたと推計した。KDDIの後日の集約ページでは、音声約2,278万人、データ少なくとも765万人とされている。詳細原因の調査がまだ続いていた時点で、ロイターは最大3,915万人が影響を受ける可能性があり、そのうち26万が法人利用者だと報じた。
これらを平均したり足し合わせたりしてはならない。初期の最大値は進行中の事案における潜在的な対象規模であり、総務省とKDDIの数値は別の時点と方法による公的推計である。音声とデータの利用者は重なり得るうえ、契約、回線、人数、通信試行は同じ単位ではない。数字に出所と定義を残すことは、慎重すぎる処理ではなく、根拠のない新しい総数を作らないための最低条件である。
経路変更の欠落が「半分だけ失敗する」状態を生んだ
発端は、多摩ネットワークセンターにある全国中継網コアルーターの保守だった。総務省の技術検証によると、作業には誤った、または古い手順が使われ、VoLTEトラフィックに必要な経路変更が記載されていなかった。その結果、音声制御トラフィックは意図どおりに動かない経路へ向けられたままになった。
危険だったのは、経路が完全に停止したのではなく、断続的に応答した点である。検証では、関係する応答が約2回に1回失敗する状態が再構成された。完全停止なら明確な故障判定や切り替えにつながりやすい。成功と失敗が混在すると、端末やネットワーク機能は「まだ使える」と判断して同じ経路を試し続ける。
VoLTE通話には位置登録が欠かせない。端末は加入者として認証され、どこで着信可能なのかをネットワークに登録してから、通常の発着信を行う。確認応答が返らなければ、端末やネットワーク機能は登録が完了していないとみなし、要求を再送する。
一台の端末にとって再試行は合理的である。だが、何百万台もの端末と分散制御機能が同じ判断をすれば、再試行そのものが障害負荷になる。失われた応答が新しい要求を生み、新しい要求が呼制御と加入者データベースの容量を消費し、処理能力の低下がさらに多くの失敗を生む。最初の経路不備が、ネットワーク自身によって増幅される循環へ変わった。
総務省は、多摩のVoLTE呼制御機能に通常のおよそ7倍、その他のVoLTE拠点に約6.5倍の負荷がかかったと推計した。分散アーキテクチャが処理と再試行を全国へ配ったため、局所的な保守ミスが全国連動の制御系へ入ったのである。
ここに最初の説明責任上の境界がある。手順の誤りは異常トラフィックが始まった理由を説明するが、全国へ拡大し数日続いた理由のすべてではない。実際のトポロジーが信号をどう分配したか、部分的な応答損失に再試行規則がどう反応したか、輻輳防御がこの状態を異常として認識できたかまで見なければならない。本件をBGPリーク、経路ハイジャック、サイバー攻撃、DNS障害、周波数障害、あるいは単純なハードウェア故障と呼ぶのは、確認された仕組みを別の物語に置き換えることになる。
VoLTEと加入者状態が互いの輻輳を増幅した
VoLTE呼制御ノードだけで通話が成立するわけではない。位置登録や音声セッションの確立には、認証、ポリシー、課金、位置・サービス状態を扱う加入者データベースも関わる。VoLTE側の再試行が増えれば、データベースへの要求も増える。データベースが輻輳してエラーを返すと、端末とネットワーク機能がさらに要求を送り、輻輳を深める。
一部端末の動作では、音声セッション確立の失敗が登録状態にも影響した。そのため、データ向け加入者データベースが当初の輻輳点でなくても、端末によってはデータ通信が断続的に使えなくなった。証拠が示すのは、音声、SMS、端末挙動や流量制御に関連するデータ影響を伴った全国通信障害である。日本全国の全モバイルデータが影響時間を通じて連続停止した、という意味ではない。
高負荷は制御状態の整合性も損なった。認証セッションが激しく変動する中、一部のVoLTE呼制御ノード内部で同期が正しく行われなかった。6台のノードは状態が整合しないまま定期バックアップを作成した。運用担当者が最新バックアップを使って呼制御機能を再起動すると、その6台では異常状態が運用環境へ戻ってしまった。
機器が再起動したという事実だけでは、復旧を意味しない。読み込まれた状態が認証失敗と位置登録再試行を引き起こし続ければ、通常なら障害を除く操作が障害の一部を保存する。バックアップは記録ではあっても、作成時のネットワークが整合していたことまで保証しない。
さらに、VoLTE機能、加入者データベース、パケットデータゲートウェイであるPGWの間でもセッション状態が食い違った。データベース輻輳中に削除されるべき情報が残り、その後の新しいセッションと競合する場合があった。修正には、すでに圧迫されている設備の容量を守りながら、複数システムを同じ状態へ収束させる作業が必要だった。
この障害が示す核心は、運用中の現実が書類上の意図に優先するという点にある。バックアップの存在、承認済みの手順、リセットコマンドの成功は、それだけではサービス継続の証明にならない。実際の経路、応答、再試行、同期、セッション、端末から見た結果を観測し、復旧によってクリーンな状態へ移れたことを確認する必要がある。
復旧は一つの操作ではなく、連鎖を断つ作業だった
KDDIの対応には複数の介入が含まれた。総務省は、接続要求とVoLTEトラフィックの流量制御、呼制御機能の再起動、一部PGWの切り離しによる加入者データベース負荷の軽減、PGWセッションの初期化による不整合の修正、そしてPGWトラフィックを受け持つ加入者データベース資源の変更を挙げている。
それぞれが循環の別の部分に作用した。流量制御は新しい需要を抑え、PGWの切り離しとセッション初期化は加入者系に提示される状態を変え、負荷分散は特定経路がボトルネックであり続けるのを防ぎ、呼制御の再起動は異常処理の解消を狙った。どれか一つを復旧の決め手として語れば、他の必須作業を見失う。
特に難しかったのが、異常状態を保った6台のVoLTE呼制御ノードである。総務省によれば、ノードがすでに異常だったため、遮断処理の試行は正常に完了しなかった。他の負荷源が減った後も過剰な信号を出し続け、最終的に6台を隔離して初めて、残っていた再試行源が止まり、輻輳が収束した。
この順序は、「復旧作業完了」と「サービス復旧」が同じではない理由をよく示す。物理作業や設定変更が終わっても、稼働中のネットワークは輻輳しているかもしれない。データ経路の多くが戻っても、音声には制限が残る場合がある。通話成功率が通常値に近づいても、長時間の高負荷が隠れた状態を残していないか、関係システムを調べ続ける必要がある。
総務省は後に、KDDIが示した「復旧作業終了」と「全面的なサービス再開」の区別について問題を指摘した。KDDIの意図では、作業終了後に流量制御を外し、正常性を確認する段階が続いていた。しかし、一部の利用者や報道機関は作業終了をサービス復旧と理解した。実際には、その後も輻輳と通信制限が残っていた。
これは広報だけの失敗ではない。技術状態を分けて測れなければ、言葉も曖昧になる。望ましい障害情報は、発端となった不備の除去、再試行増加の抑制、輻輳の解消、セッション状態の一致、流量制限の解除、音声・データ成功率の安定、依存サービスの端末間確認を別々に示すべきである。
影響は携帯電話の画面を越えた
KDDIの説明には、配送状況と運転手への連絡、コネクテッドカー、気象データ収集、水道メーター、銀行ATM、空港の無線通信、バス決済などへの影響が列挙されている。ロイターも気象データ、荷物配送、銀行、コネクテッドカーの混乱を独自に報じた。
モバイル接続は、別のサービス内部で制御や報告を担う回線になり得る。個人には電話がかけられない障害として見え、物流会社には状況更新の欠落として見える。公共機関では観測値が届かず、交通や金融の遠隔端末では日常処理が完了しない場合がある。モバイルコアの継続性は、携帯契約者だけの問題ではない。
もっとも、列挙されたすべてのサービスが全国で61時間25分ずっと停止したとまでは言えない。事例が示すのは依存関係の広がりであって、個々の業務に共通する一つの停止時間ではない。それぞれの影響範囲を、通信障害全体の時計から推測してはならない。
最も重大な継続性の論点は緊急通報である。ロイターは、生命と財産を守る消防・緊急通報が妨げられたことに総務相が懸念を示したと報じた。共同通信は、一部利用者が長時間にわたり110番または119番へ発信できなかったと伝えた。公開情報からは、失敗した通報の件数、個別の緊急事案数、負傷者数、死亡者数は確認できない。
不明な部分を推測で埋める必要はない。長時間の全国モバイル障害で緊急番号への接続が阻害された、という確認可能な事実だけで十分に重い。問うべきは、音声位置登録、加入者認証、通常の流量制御が不安定なときにも、緊急通信へ到達できる経路と保護容量を事業者が実証できるかである。
重大事故の検証は統制上の欠陥を示すが、司法判断ではない
総務省は本件を重大な事故として扱い、専用の技術検証を行った。原因を一人の人為ミスへ縮小せず、手順の選択と承認、サービス正常性の確認、リスク評価、輻輳制御設計、全国波及の評価、高負荷時の再起動試験、複雑な復旧手順、事故対応訓練、利用者への情報提供に不足があったとした。
この多層的な認定には意味がある。誤った手順が事故のきっかけになっても、全国ネットワークの強靱性は、人と手順が時に失敗することを前提に設計されなければならない。部分応答を検知し、再試行を抑え、分散構成に隔離境界を持たせ、異常負荷下でバックアップと再起動を試験し、通常の自動処理では抜け出せない状態からの退路を訓練する必要がある。
KDDIは、手順と承認の強化、輻輳検知の改善、輻輳制御設計の見直し、復旧手順と支援機能の改良、利用者向け情報の改善などを報告した。これらは確認された故障経路に対応している。しかし、公開情報は、2026年時点の有効性や全設備への適用状況を独立して検証したものではない。「対策を実施した」という記録だけで、現在の実効性までは証明できない。
KDDIは利用者への補償も発表した。集約ページでは、24時間以上連続してすべての通信が使えなかった場合またはそれに相当する条件を満たす利用者への約款返金と、より広い利用者を対象とする200円の「お詫び返金」を分けている。共同通信は、補償費用が約73億円に達する見込みであり、社長が自主的に報酬を減額すると報じた。
これは事業者による補償と経営上の対応である。規制当局による金銭罰、刑事処分、裁判所による法的責任の認定ではない。公開情報が裏づけるのは、重大事故という分類、総務省の検証結果、報告された再発防止策と補償制度までである。記録にない法的結論や個人責任へ言い換えることはできない。
継続性の証拠は稼働中のサービスを語らなければならない
この事案から、継続性の証拠を三つの層に分けられる。第一は意図された状態である。承認済み手順、期待される経路、設定済みの輻輳制御、復旧計画、利用者通知方針がこれに当たる。重要な記録だが、システムが実際にそのとおり動いていることまでは示さない。
第二は観測された技術状態である。VoLTE信号が実際に通る経路、応答の返却率、再試行の分布先、呼制御ノード間の同期、加入者とPGWのセッション整合性、再起動時に読み込まれたバックアップの状態を把握しなければならない。文書上の予定ではなく、ネットワークが今何をしているかを示す層である。
第三はサービスの完了状態である。ノードが正常と表示されても、利用者が登録し、発着信し、SMSを送り、データ通信を利用し、緊急通報先へ到達できるとは限らない。代表的な端末、地域、サービス、依存組織を通じた端末間確認が必要であり、対外的な復旧宣言はその結果に従うべきである。
行政の事故報告は、用語、数値、時系列、原因、改善要求を保存する重要な記録である。しかし、報告書そのものは通信を運ばず、再試行を止めず、セッションを整合させず、緊急通報を接続しない。その運用上の価値は、過去の事故を、現在のネットワークで繰り返し実施すべき試験へ変えるところにある。
KDDIの2022年障害後に残る決定的な問いは、元の経路が修正されたかどうかだけではない。類似の断続障害を局所に閉じ込められるか、再試行需要を上限内に保てるか、復旧用データを信頼できるか、運用担当者が可視性を保てるか、そして対外説明が利用者の実際の通信結果と一致するかを、現在の統制が証明できるかである。
公開情報が示していないこと
総務省報告は詳細な技術経過を再構成しているが、全内部ログ、復旧時の全コマンド、個々の意思決定者、端末ごとの完全な影響統計までは公開していない。失敗した緊急通報、個別の緊急事案、負傷、死亡、経済損失の数量も確定していない。
公式の影響推計が時点によって変わったことも、情報が無価値だという意味ではない。初期の最大3,915万人は調査中の潜在的対象規模、総務省の音声約2,316万人・データ少なくとも775万人は検証報告の推計、KDDIの音声約2,278万人・データ少なくとも765万人は後日の集約値である。数値ごとに主体と方法を残せばよく、統合して新しい数字を作る理由はない。
2022年に公表された再発防止策の一覧から、現在の有効性を断定することもできない。機能が導入されても全ノードを覆っていない可能性があり、手順が変わっても断続的な応答損失と全国規模の再試行負荷で試されていない可能性がある。実験室で成功した訓練が、不整合な加入者状態を再現しているとも限らない。
こうした限界を明示することは、説明責任を弱めない。むしろ、結論を実証可能な範囲に保つ。具体的な保守・経路不備から始まり、観測可能な再試行と輻輳で拡大し、不整合な状態を引き継いで長期化し、重要な依存サービスに及び、多段階の復旧を要した。それが確認できる事実である。問うべきは統制と証拠であり、裏づけのない被害、法的結論、個人非難ではない。
出典
会員向け解説
プロフィールの詳細
適切な会員レベルでログインすると、解説全文と出典メモをご覧いただけます。
Strategic Circle 限定
Strategic Circle
すべての読者に公開されています。参加してログインすると プロフィール解説 を閲覧できます。
Strategic Circle に参加Leadership Alliance 会員限定
Leadership Alliance
対象となる IP 資産の所有者・管理者向けです。ログインすると Leadership Alliance の解説を閲覧できます。
Leadership Alliance に参加
