概況

  • オランダの共同監督調査は、KPN の主要な電話障害を2019年6月24日の15:34から18:52までの間と特定している。固定電話と携帯電話の音声は KPN 顧客にとってほぼ完全に利用不可能となり、通常の112番通報経路も機能しなかった。インターネットサービスは引き続き動作したため、これは接続性の完全な喪失ではなく、通話ルーティングと緊急時継続性の障害であった。[1][2][5][7][10]
  • 障害は事業者の境界を越えた。調査によると、すべての固定電話および携帯電話事業者からの112番通報は、国家公共安全応答拠点に到達する前に KPN の電話網を経由していた。したがって、一社が運営するプラットフォームが共有の国家的依存関係となっていた。[3][5][7]
  • 技術的メカニズムは名目上の冗長性を無効化した。独立して動作する4つのルーティングシステムは、ソフトウェア変更後にカウンターが同期するようになった。警告スクリプトは意図した通りにリセットしなかった。カウンターはほぼ同時に負の状態に達し、通話試行の繰り返しでエラーメッセージが増加し、プラットフォームはルーティング要求の処理を停止した。[2][5][7]
  • 別の設定問題により、KPN の NL-Alert メッセージの4G 配信が妨害された。共同報告書はこの障害を音声障害の原因として扱っていない。その重要性は、同時発生の継続性プレッシャーにある。電話障害の際に役立つと期待された警告チャネル自体が損なわれ、一貫性のない地域および国のメッセージが警報連鎖を混雑させた。[2][5][7][18]
  • KPN は復旧作業と是正措置を報告した。これには、ソフトウェア設定の変更や、ルーティングプラットフォームが低速化または停止した場合の112番通報のためのより迅速な代替経路が含まれる。規制当局はまた、112チェーン全体にわたる継続的なテスト、変更への耐性強化、同一ソフトウェアと共有依存関係への注意を求めた。措置が受け入れられた、または実施されたという声明は、それ自体では長期的な有効性の公的証明にはならない。[2][7][9][10]
  • 責任は実際の制御に従う。KPN はルーティングプラットフォームのアーキテクチャ、ソフトウェア変更、監視、復旧エビデンスを管理した。他の事業者は、依存関係の認識と顧客向け継続性を管理した。政府、警察、安全地域、医療機関は、フォールバック計画と公的指示を管理した。規制当局は、要件、調査、フォローアップを管理した。信頼できるクローズアウトは、通常の国家通話経路が機能しない場合に、これらの管理がどのように連携するかを示す必要がある。

国民サービスは一つの事業者の通話経路に依存していた

責任を割り当てるための出発点は、ソフトウェアの欠陥ではない。それは、その欠陥が重要になる前に緊急通報がたどらなければならなかった経路である。

共同調査は集中化されたチェーンを説明している。人が固定電話または携帯電話の音声サービスから112番に電話をかけた。すべての音声事業者からのトラフィックは、KPN の電話網を通じてドリーベルヘンの公共安全応答拠点に送られた。そこでオペレーターが応答し、適切な地域緊急対応センターに転送し、その後必要なサービスに通報した。警察の長が112ドメインの管理者であり、法務・安全大臣がチェーン全体の責任者であった。[2][7]

そのアーキテクチャは組織的な責任を分散させたが、重要な輸送機能を集中させた。KPN の加入者でない人でも、別の事業者と商業関係を持ちながら、112への最終的な国家経路を KPN に依存していた。したがって、KPN のルーティング障害の公共安全への影響は、KPN の小売顧客ベースに限定されなかった。これが、このインシデントを、一社の加入者の何パーセントが通話できたかだけで測定される通常のサプライヤー障害として分析すべきではない理由である。

依存関係は冗長性の意味も変える。モバイル事業者は自社ネットワーク内に多様な無線サイト、輸送リンク、コアコンポーネントを持つことができる。固定事業者は別のアクセス技術を持つことができる。これらの設計選択は、すべての経路が同じ下流のルーティングプラットフォームに収束する場合、緊急通報の回復力を確立しない。独立性はサービス経路全体で持続しなければならない。収束点以前の多様性は、通常の可用性を向上させる一方で、共通の国家障害領域を無傷のまま残すことができる。

共有された国家入口自体に本質的に無責任な点は何もない。集中化は、通話処理、位置特定、転送、運用調整を簡素化できる。また、専門的な管理を維持しやすくすることもできる。しかし、集中化はエビデンスの要求水準を引き上げる。共有ポイントの事業者は、冗長性が物理的であるだけでなく、状態が名目上別々のシステム間で黙って同期しないこと、障害が繰り返しの要求によって増幅されないこと、プラットフォームを迂回する経路が現実的な負荷の下で利用可能であることを示さなければならない。

チェーンの責任を負う公的機関には並行した義務がある。契約上の多様性がどこで終わり、技術的な収束がどこから始まるかを特定するアーキテクチャマップが必要である。どの組織がトラフィックを再ルーティングできるか、どの組織がフォールバックが安全であると宣言できるか、どのテストがすべての元のネットワークから人間の応答と地域転送までの通話を実際に行使するかを知る必要がある。そのエンドツーエンドのビューがなければ、各参加者は自社のコンポーネントが利用可能であると報告できる一方で、公共サービスは到達不能のままである。

2019年の障害はこの管理のギャップを明らかにした。KPN は通常の転送を停止させたプラットフォームを所有・運用していた。しかし、社会的依存は KPN よりも大きく、それを緩和する能力は事業者、警察、省庁、安全地域、緊急サービス、医療機関に分散されていた。したがって、説明責任は「KPN のバグ」または「政府の準備」のいずれかに還元することはできない。アーキテクチャは両者に明確な管理義務を生み出した。

タイムラインは、検出、診断、復旧、公共回復を分離する

監督記録は、単一の停止期間の数値よりも有用な時系列を提供する。

15:32、KPN の監視センターは可視トラフィックの減少の最初の報告を受け取った。さらに報告が続いた。共同報告書は15:34からの主要な機能不全を特定している。KPN は監視信号、顧客応答、自社組織からの報告を使用して緊急手順を開始した。最初の信号と広範なサービス喪失の定義された開始は時間的に近接していたが、異常トラフィックの検出はメカニズムを知ることや経路を復旧することと同じではなかった。[2][7]

17:45、調査チームは原因を特定した。18:30、KPN は最初のシステムの再起動に成功した。18:52、音声サービスと公共安全応答拠点へのアクセスが復旧した。これらのタイムスタンプは、いくつかの運用上の質問を区別する。監視は症状を迅速に確認した。技術的な診断は最初の可視的な減少から約2時間かかった。再起動が回復を開始したが、完全なアクセス可能性は後になった。各間隔は異なる管理面に属する: テレメトリ、インシデントエスカレーション、障害分離、安全な再起動、サービス検証。

公共の回復はネットワーク復旧を超えて拡張された。政府機関、警察、安全地域、緊急サービス、医療機関は危機運用を拡大し、代替手段を提供しようとした。21:00までに、組織は危機構造を縮小した。解決を報告する最終 NL-Alert メッセージは21:30に送信された。18:52のネットワーク復帰は、公的指示の調整、通常の連絡経路の再開、一時的な取り決めの撤回の必要性を即座に取り除くものではなかった。[2][7]

この時系列が重要なのは、可用性メトリクスが応答の形状を隠す可能性があるからである。3時間の停止は4時間の内部基準内にあるように見えるかもしれないが、緊急サービスは期間だけで適切に測定されない。影響を受けた人数、国家的範囲、通話の重要性、代替サービス番号の喪失、フォールバック指示に関する混乱がすべて影響を変える。KPN 自身の2019年の報告は後に、加重ダウンタイムパフォーマンス指標が深刻な社会的影響を伴うインシデントを十分に代表しているかどうかを疑問視した。[10]

タイムラインはまた、公的に利用可能でないエビデンスを露呈する。報告書は、すべてのアラーム、カウンター値、オペレーターコマンド、エスカレーション決定、再起動基準を提供していない。個人のエンジニアやソフトウェアサプライヤーを意思決定の責任者として特定していない。15:32から17:45までの完全なイベントログを示していない。これらのギャップは確立されたメカニズムを消去するものではないが、なぜ診断にこれほど時間がかかったのか、異なる運用選択がインシデントを短縮できたのかについての主張を制限する。

厳密なクローズアウトはこの分離を保存する。検出エビデンスは、最初の意味のあるしきい値がいつ越えられたか、スタッフが112が影響を受けていることを理解していたかを示す。診断エビデンスは、応答者が負荷を状態破損からどのように区別したかを示す。復旧エビデンスは、なぜ1つのシステムの再起動が安全であり、トラフィックがどのように制御されたかを示す。サービスエビデンスは、各事業者からの成功した通話を示す。プラットフォームプロセスが実行中であることのみではない。公共回復エビデンスは、正確で一貫性のある代替手段がいつ市民に届いたかを示す。「解決済み」は、それらのテストの最初ではなく最後であるべきである。

引き金となった欠陥は根本原因の一層にすぎない

共同報告書は、ルーティングプラットフォームの障害について異常な具体性を示す一方で、なぜ「ソフトウェアバグ」が不完全な説明になるのかも示している。

KPN の通話ルーティングプラットフォームは電話網の重要な部分であった。通話を正しい経路に配置するために必要な情報を提供し、112への通話も含まれていた。プラットフォームには、独立して動作すると説明される4つの通話ルーティングシステムが含まれていた。直接の障害には、ソフトウェア設定、同期操作、ルーティング要求の監視に使用されるカウンターが関与していた。[2][7]

報告書は連鎖を説明している。プラットフォームのサービス管理システムにおけるソフトウェア変更が、意図せずして4つのルーティングシステムのカウンターを同期的に実行させた。2019年1月に実装された別のスクリプトは、カウンターが最大値の95%に達したときに警告することを意図していたが、実装エラーによりカウンターが時間内にリセットされなかった。6月24日、4つすべてのカウンターがほぼ同時に負の値に達した。その状態が大量のエラーメッセージを生成した。新しいルーティング要求ごとに別のエラーが発生し、通話試行の繰り返しがトラフィックを増加させた。約1時間のエラーと要求の負荷の蓄積後、プラットフォームは通話ルーティング要求を処理できなくなった。[2][7]

この連鎖には、分析的に異なる少なくとも4つの要素が含まれている。

引き金となった条件は、カウンターが負の状態に移行したことである。潜在的な技術的欠陥は、カウンターが同期して一緒に失敗することを可能にしたソフトウェアと設定の動作であった。検出管理は、警告およびリセットスクリプトが意図した通りに動作しなかったために失敗した。増幅条件は、各ルーティング要求が別の格納エラーを生成し、発信者が自然に再試行したために生じた。アーキテクチャ上の結果として、独立しているように提示された4つのシステムは、もはや有用な障害分離を提供しなくなった。

報告書は別の依存関係の決定を追加している。2018年6月、KPN は112プラットフォームがアップグレードされている間、通話ルーティングプラットフォームを使用して112トラフィックをルーティングし始めた。ルーティングプラットフォームが失敗したとき、緊急通報をルーティングするために必要な情報が利用できなくなった。その決定はカウンターの欠陥を生み出したわけではないが、プラットフォームの障害を国家的な緊急アクセスに結び付けた。したがって、それは直接の引き金ではなく、寄与するアーキテクチャ上の条件である。[2][7]

これらの層を分離することで、説明責任が最後に見えるエラーに崩壊するのを防ぐ。カウンターは、ソフトウェアが誤った動作をしたためにオーバーフローまたは負になる可能性がある。しかし、組織は状態がどのように分割されるか、どのアラートがテストされるか、同一システムが管理プレーンを共有するかどうか、エラーストレージが需要の下で成長したときに何が起こるか、緊急トラフィックが同じロジックに依存しない経路を持つかどうかを決定する。スクリプトにおける人間のミスは現実的であり得るが、完全な根本原因ではない。

同じ規律は、裏付けのない主張から保護する。公開記録は、ベンダー、正確なコードモジュール、カウンター幅、最大値、スクリプトを書いたエンジニア、またはサービス管理変更の承認プロセスを特定していない。これらの詳細を提供することでメカニズムをより技術的に感じさせようとするのは魅力的かもしれないが、そうすることは証拠を発明に置き換えることになる。確立された結論はより狭く、それでも重要である: 独立しているとされるルーティングシステムは、冗長性を無効にする共有状態動作を持ち、意図された警告管理が同期した exhaustion を防ぐことに失敗した。

4つのシステムは4つの独立した障害ドメインではなかった

冗長性はしばしば数として伝えられる。4つのシステムは1つよりも安全に聞こえる。KPN のインシデントは、コンポーネントの数が独立した障害ドメインの数と同じではない理由を示している。

通話ルーティングシステムは通常の意味で別々に動作し、それでもこのイベント中に重要であったプロパティを共有していた。それらは同一または密接に関連するソフトウェアを使用し、共通のサービス管理変更の影響を受け、同期するようになったカウンターを維持し、それらのカウンターが障害条件を超えたときに同様に反応した。それらの物理的またはプロセスの分離は、共通の状態遷移を止めなかった。同じ障害が4つすべてに達すると、アーキテクチャの冗長容量はトラフィックを問題の周りに運ぶことができなかった。[2][7]

これはコモンモード障害である: 複数のコンポーネントが原因、依存関係、状態、または仮定を共有するために失敗する。この用語は「大規模停止」の漠然とした同義語として使用すべきではない。それは、なぜ冗長性が期待通りに確率や影響を減少させなかったかを特定する。この場合、同期がリスクを変えた。異なる時間に問題のある状態に達していたであろうカウンターは、警告、部分的な障害、または他のシステムが続行している間に1つのシステムをリセットする機会を生み出したかもしれない。アラインメントは、段階的な露出をほぼ同時の喪失に変換した。

エラーストレージメカニズムは、コモンモードを運用上さらに悪化させた。通話が再試行されるにつれて、より多くの要求がより多くのエラーメッセージを生成した。公的なストレス下にあるサービスは、正当かつ予測可能な需要を経験した: 人々は通話が接続されないときに再度電話する。再試行を蓄積する内部エラー作業に変える設計は、ユーザーが助けを求めるにつれて回復から遠ざかることができる。したがって、負荷遮断、境界のあるログ記録、背圧、緊急トラフィックの優先順位付けは、ここでは単なる一般的なパフォーマンス機能ではない。それらは安全の継続性の一部である。

規制当局の推奨事項は、教訓を KPN を超えて明確に拡張した。通信セクターは、運用システム、データベース接続、構成変更、ソフトウェア更新、同一ソフトウェアに関わる新たな弱点と依存関係を特定するよう求められた。そのリストはアーキテクチャテストである。それは、冗長であるとされる要素が同じデータストア、制御プレーン、リリースパッケージ、運用手順、または障害に敏感な状態を共有しているかどうかを問う。[2][7]

真の独立性の証拠は具体的であるべきである。それには、段階的な状態、別々の管理ドメイン、正当化される場合のバージョンの多様性、境界のある障害効果、障害のあるプラットフォームをバイパスする緊急経路、そして正確なコモンモード条件を注入するテストが含まれる。また、組織的な独立性も含まれる: システムを隔離し、トラフィックを再ルーティングし、変更を停止する権限を、失敗している同じチームやツールを待たずに行使できること。

これらの管理はいずれも、4つのボックスを示す図から推測されるべきではない。また、システムが冗長であるという声明から推測されるべきでもない。証拠は、共通の管理変更が間違っているとき、カウンターが一緒に境界条件に達したとき、エラーログが加速するとき、発信者が国家的規模で再試行するときに何が起こるかを実証する必要がある。負担は、プラットフォームが他の事業者からの緊急トラフィックを運ぶときに特に高い。

フォールバックは、失敗した仮定を回避する場合にのみ独立している

KPN は、ルーティングプラットフォームが低速化または停止した場合に、112トラフィックを代替チャネルを通じて迅速に再ルーティングできるようにすることで回復力を改善したと報告した。これはインシデントに対して方向性的に応答している。それは、単に同一システムを再起動するのではなく、プラットフォームを迂回する必要性に対処する。この声明は、独立性と証明に関する重要な質問を未解決のままにしている。[2][7]

同じ制御プレーン、サービス管理ソフトウェア、データベース、ルーティングデータ、または運用承認経路を使用するフォールバックは、トポロジー的には代替的であっても、障害においては共通である可能性がある。プライマリとバックアップが同じ破損した状態を読み取り、同じカウンターに依存し、障害のある管理システムからのコマンドを必要とする場合、経路を切り替えても原因は除去されない。インシデントは、「代替」を分解しなければならない主張にする。

技術的独立性は、バックアップが失敗したプラットフォームなしで正しい緊急経路を決定し転送できるかどうかを問う。容量独立性は、単なる小さなテストコールではなく、国家的な再試行需要を運べるかどうかを問う。状態独立性は、別個のメカニズムを通じてルーティング情報を維持または受信するかどうかを問う。制御独立性は、通常の管理ツールが劣化しているときにオペレーターがそれを呼び出せるかどうかを問う。組織的独立性は、誰が切り替える権限を持ち、その権限が24時間利用可能かどうかを問う。

時間も重要である。存在するが、発動前に2時間の診断を必要とするフォールバックは、応答者が原因を理解した後にのみ回復時間を短縮するかもしれない。より安全な設計は、観察可能なサービス基準を使用できる: エンドツーエンドの緊急通話成功率がしきい値を下回った場合、正確な欠陥が分かる前にプラットフォームからトラフィックを遠ざける。そのアプローチは、誤った切り替えや過負荷を含む独自のリスクを生み出すため、テストされなければならない。しかし、それは継続性を障害診断からサービス成果へと移す。

2018年6月に112を通話ルーティングプラットフォーム経由でルーティングする決定はここで関連する。一時的または移行に関連する依存関係は、耐久性のある運用上の仮定になる可能性がある。したがって、アップグレードプログラムは明確な有効期限と検証記録を携行すべきである: なぜ依存関係が導入されたのか、いつ削除されるのか、どのような障害モードを追加するのか、中間コンポーネントが失敗した場合にどの経路が残るのか。公開報告書は完全な決定記録を開示していないため、これらの管理が存在したかどうかを確立することはできない。しかし、プラットフォームの障害が112に到達不能にしたことを確立している。

独立したフォールバックは KPN を超えて拡張される。他の事業者は、共有経路なしで、どのような条件下で緊急通報を配信できるかを知る必要がある。公的機関は、通常の音声サービスを前提としない代替手段を必要とする。医療機関は、ユーザーが訓練され、依存関係が理解されている通信ツールを必要とする。スタッフが使用方法を知らないバックアップネットワークは、技術的経路が分離されていても運用上独立していない。

したがって、インシデント後の適切な質問は「バックアップが追加されましたか?」ではなく、「バックアップはどの失敗した仮定を回避し、プライマリプラットフォーム、管理プレーン、通常の通信が損なわれている間に国家的な緊急トラフィックを運べることを示す証拠は何ですか?」である。

エンドツーエンドテストはガバナンス管理であり、最終的な技術チェックではなかった

共同報告書は、112チェーンにおけるエンドツーエンドのサービス管理の欠如を特定し、経路全体にわたる継続的なテストと監視を推奨した。KPN が TDM ネットワークでコールジェネレーターを使用して112ルーティングを継続的にテストしていた一方で、アップグレードされた112プラットフォームの実装後、モバイルネットワークでは同等の方法が利用できなかったと指摘した。[2][7]

その発見は説明責任の中心である。コンポーネントテストは、発信元ネットワークが112コールを受け入れたこと、KPN ルーターが正常であること、応答拠点がテスト入力を受信できること、地域センターが転送を受け取れることを示すことができる。どれも、各プロバイダーからの実際の通話がすべての依存関係を通過し、意図された人間のエンドポイントに到達することを証明しない。公共サービスはチェーンであり、個々のコンポーネントではない。

継続的なテストは、必ずしも制御なしで緊急運用に可聴テストコールを配置することを意味しない。それは、オペレーターや一般の人々を混乱させずに、シグナリング、ルーティング、転送、観測可能性を実行する安全な方法を作成することを意味する。合成トランザクションは、マークされ、レート制限され、制御されたエンドポイントに向けられることができる。技術的な設計は重要であるが、所有権も重要である。誰がどの発信元をテストするかを決定し、誰が障害を受け取り、アラートがどのくらい迅速にエスカレートされ、いつ失敗したテストが継続アクションを引き起こすかを決定しなければならない。

カバレッジはアーキテクチャに従うべきである。テストは、各モバイルおよび固定プロバイダーから、関連するアクセス技術から、収束を露呈する条件から発信される必要がある。通常のルーティングと代替経路を検証する必要がある。変更の前後、および簡単な機能チェックでは再現できない長時間実行状態をテストする必要がある。境界テストには、カウンターの exhaustion、同期状態、エラー量の増加、再試行の効果を含めるべきである。

結果は緊急サービスの成果として測定されるべきである。通話は国家応答拠点に到達したか?発信者情報は期待通りに処理されたか?通話は正しい地域に転送できたか?往復時間は許容可能だったか?監視は障害を正しい依存関係に関連付けたか?エンドツーエンドの通話が失敗している間に緑色のままのプラットフォーム健全性ダッシュボードは、意味のある保証ではない。

ガバナンスは、チェーンが組織を超えるために入ってくる。KPN は自分が管理するものをテストできたが、大臣、警察、他の事業者、安全地域、緊急サービスは経路の他の部分を管理していた。単一のコンポーネント所有者は、協力なしにサービス全体を認証できなかった。したがって、規制当局の推奨は共有運用モデルを暗示していた: 合意されたテストケース、共通のしきい値、証拠の保持、エスカレーションの義務、改善を要求する権限。

すべての機微なテスト詳細の公開は不適切であろう。しかし、集約された証拠は、悪用可能なアーキテクチャを明らかにせずに公開できる: 事業者とアクセス種類別のカバレッジ、テスト頻度、失敗率、最大検出時間、フォールバック演習日、重要な調査結果のクロージャ。そのような証拠は、規制当局と一般市民が、受け入れられた推奨事項と機能する保証プログラムを区別することを可能にする。

監視はトラフィック減少を確認したが、重要な条件を見逃した

KPN の監視センターは15:32に信号を受信し、これは報告された広範な機能不全の開始に近い。これは、ある程度の観測可能性が機能した証拠である。より難しい問題は、組織が先行条件と公共サービスの成果を監視したかどうかである。

カウンターは負になる前に最大値に近づいていた。スクリプトは95%で警告し、タイムリーなリセットをサポートすることを意図していたが、実装エラーにより管理がその役割を果たすのを妨げた。これは単に顧客が電話できなかったことに気づかなかった失敗ではない。それは、プラットフォームが要求の処理を停止する前に危険な状態を表面化させるべきだった特定の予防信号の失敗であった。[2][7]

この区別はインシデント経済にとって重要である。障害が始まった後の全国的なトラフィック減少の検出は、復旧を短縮できる。境界交差前の同期カウンター成長の検出は、インシデントを防止できる。監視予算と運用上の注意は、したがって、それらが可能にする管理によって判断されるべきである。ダッシュボードメトリクスは、オペレーターまたは自動化システムに影響が出る前に安全に行動させることができない場合、限られた価値しか持たない。

報告書はまた、過負荷を防ぐためのネットワーク要素間の特定のパフォーマンス指標の交換が不十分であることを指摘した。これは別の境界を示唆する: ローカルコンポーネントは、エンドツーエンドのサービス信号に変換されることなく、キュー、エラー、または容量プレッシャーについて知っていた可能性がある。複雑なネットワークは、ローカル診断とサービスレベルの合成の両方を必要とする。ローカル詳細は診断をサポートする。サービス成果は優先順位付けをサポートする。

再試行トラフィックは予測可能だった。通話が静かに失敗するか接続されないとき、発信者は再試行し、機関はサービスを確認しながら追加の通話を発信する可能性がある。監視は、元の需要を再試行増幅から区別し、公共の関心が負荷を増加させることを予測すべきである。エラーパスが再試行ごとに作業を保存するシステムは、特に厳格な境界とアラートを必要とする。

説明責任のある監視クローズアウトは、少なくとも4つの層を示すだろう。予防テレメトリは、カウンター、状態アラインメント、境界条件を示す。プラットフォームテレメトリは、ルーティング成功率、エラー率、キュー、ストレージプレッシャーを示す。サービステレメトリは、各事業者からの成功したエンドツーエンドの112コールを示す。社会的テレメトリは、フォールバック番号と公的指示が正常に使用されているかどうかを示す。これらの層は異なる決定と所有者をサポートする。

公開記録は、イベント後に導入された正確なしきい値や完全な警報履歴を示していない。1つの失敗したスクリプトがすべての監視を代表していたと想定すべきではない。しかし、確立されたギャップは、初期症状の迅速な検出が適切な管理を証明するという単純な主張を却下するのに十分である。インシデントは最初の報告されたトラフィック減少の近くで始まった。なぜなら、より早期の予防管理が同期状態を制約していなかったからである。

別の NL-Alert 障害は公共警告の独立性をテストした

NL-Alert は別の理由で失敗した。6月24日、4G レポートに接続された設定変更と定期的なネットワークスキャンが、KPN の Cell Broadcast プラットフォームのアダプターを過負荷にした。KPN は問題が特定され翌日に解決されるまで、4G 経由で NL-Alert メッセージを処理できなかった。共同報告書はこれを電話ルーティング障害とは別のものとして明確に扱った。[2][5][7]

その因果的境界は保存されなければならない。電話カウンターは Cell Broadcast アダプターの問題を引き起こさなかった。両方がソフトウェアまたは設定に関与したという事実は、それらを1つのインシデントメカニズムにするわけではない。それらを組み合わせると、技術的説明責任が歪められ、是正措置が誤った管理に割り当てられる可能性がある。

それにもかかわらず、同時の影響はインフラの回復力に関連する。公的機関は NL-Alert を、112と国家警察サービス番号が利用できず、代替手段を提供することを人々に伝える一つの方法として使用した。4G 上の KPN 顧客は、期待された経路を通じてこれらのメッセージを受信しなかった。他の問題がその後、より広範な警報プロセスに影響を与えた: 地域および国のメッセージは多数で一貫性がなく、中央チェーンが混雑し、一部のメッセージは非常に遅れて到着し、一つの国のメッセージには新聞のチップラインに関連する誤った番号が含まれていた。[2][7][18]

これは継続性の継続性の問題であった。通常の通信が失敗したときに使用される警告システムは、それがサポートするサービスとは異なる障害仮定を持たなければならない。Cell Broadcast は音声ルーティングプラットフォームとは技術的に異なるが、両方とも依然として事業者のインフラ、設定慣行、監視、調整された公共コンテンツに依存していた。技術的多様性だけでは、使用可能な警告を保証しなかった。

少なくとも3つの独立性テストがある。配信経路は、説明することになっているインシデントを生き残らなければならない。メッセージを作成および送信するために使用される制御経路は、利用可能であり理解されたままでなければならない。情報プロセスは、競合する代替手段ではなく、1つの明確で検証済みの指示を生成しなければならない。いずれか一つでの失敗は、他のものが機能しても警告を無効にする可能性がある。

報告書は、KPN が4G NL-Alert の問題を十分に迅速に検出せず、NL-Alert が KPN 内部で別個の重要なサービスとして扱われていなかったことを指摘した。KPN は後に監視を追加し、ネットワークスキャン動作をテストに含めた。これらの措置は技術的経路に対処する。公的機関はまた、国家規模の112停止、一貫したメッセージ所有権、使用可能な代替手段のための手順を必要としていた。[2][7]

この分割は誤った非難を防ぐ。KPN はすべての地域指示を決定できず、安全地域は4G アダプターを修理できなかった。KPN はプラットフォームの検出と配信を管理した。政府機関はメッセージガバナンスを管理した。公共警告機能が成功するためには両方が機能しなければならなかった。

危機計画は存在したが、多くは運用可能ではなかった

オランダは継続性ポリシーなしにインシデントに突入したわけではない。以前の112停止に続いて合意がなされ、警察は汎用運用シナリオを維持していた。シナリオ4は公共の112インフラの喪失に最も近く、警察署と消防署の人員配置を含んでいた。2013年の政府書簡は、固定通話が失敗した場合の携帯電話の試行、モバイルが失敗した場合の固定電話の試行、または電話設備が利用できない場合の緊急サービス拠点への移動など、市民のための行動も提供していた。[2][7][18]

調査は、文書と運用準備の間のギャップを発見した。安全地域は以前の行動フレームワークに完全に関与していなかった。役割、通信方法、実施の詳細は不完全であった。一部の組織は文書についてほとんど知識がなかった。計画はしばしば地域インシデントを前提とし、国家的な利用不能を前提としていなかった。シナリオ4はまた、国家警察ホットライン0900-8844が機能することを前提としていたが、同じ KPN 障害によりその番号が利用できなくなった。[2][5][7]

これはインフラの教訓である。フォールバック指示は、プライマリサービスと同じ依存関係マップに対してチェックされなければならない。別の電話番号を提供することは、それが同じ失敗したルーティングプラットフォームに入る場合、意味がない。人々に駅を訪問するようアドバイスすることは、公衆がどの場所にスタッフが配置されているか、それらの場所が指令と機能する通信を持っている場合にのみ機能する。計画は、その運用上の前提条件が未指定のままで正式に承認される可能性がある。

イベント中、組織は即興で対応した。警察署と消防署は一部の場所で利用可能になり、追加のスタッフが配備され、ソーシャルメディアが使用され、地域の代替手段が発表された。機知はいくつかの結果を減少させたが、即興はまた一貫性のなさを生み出した。省庁は、0900-8844が利用できなかったため、より広範な選択肢を模索しながら統一された国家メッセージを遅らせた。共同報告書は、この遅延が危機コミュニケーションの制御喪失に寄与したと結論付けた。[2][7]

教訓は、すべての危機がスクリプト化できるということではない。それは、安定した部分は事前に解決されるべきであるということである。メッセージ権限、代替番号の検証、スタッフが配置された駅の位置データ、国家および地域のアクター間の通信、NL-Alert を使用するための基準は、停止前に合意できる。演習は、スタッフが計画を知っているかどうか、フォールバックが失敗したネットワークを共有しているかどうかを明らかにできる。

計画はまた、その前提条件を述べるべきである。アクションがモバイルデータが利用可能であることに依存する場合、それは明示的であるべきであり、利用できない場合のオプションとともに。2019年、KPN インターネットサービスは引き続き機能し、一部のユーザーがウェブベースの通信を可能にした。その事実は、応答の一部で WhatsApp や Skype などのツールを有用にしたが、普遍的な緊急代替手段に一般化されるべきではない。それは、データアクセス、互換性のあるデバイス、到達可能な宛先、何をすべきかを知っているユーザーを前提とする。

したがって、運用準備は文書数ではなく、観察された能力で測定される。スタッフは手順を開始できるか?代替手段はプライマリ障害を回避するか?公衆は一つの検証済み指示を理解できるか?医療機関はパートナーと連絡を取れるか?フォールバックシステムは、担当者が精通し続けるのに十分な頻度で演習されているか?報告書の推奨事項は、ポリシーレイヤーだけではそれらの結果を生み出していなかったため、実施、精通、コンプライアンスに焦点を当てた。

公共安全への害は、因果関係を発明せずに測定されなければならない

裏付けられた害は深刻だった。人々は通常の国家緊急番号を使用できず、警察サービス番号も利用できず、代替手段は地域によって異なり、警報配信は損なわれ、医療機関は通信を即興で行わなければならなかった。報告書は、緊急医療におけるギャップと substantial な社会的影響を説明している。これらの発見は、劇的だが証明されていない死傷者の主張を必要とせずに、高影響評価を正当化する。[1][2][5][7]

共同調査は、停止期間中に地域救急サービスによって報告された3人の死亡について説明している。また、サービスは該当する時間制限とプロトコル内で対応し、保健監督機関はパラメディカル支援の開始の遅延が死亡に関与したかどうかを確立できなかったと述べている。別の病院搬送は20分遅れたが、病院のレビューではその患者に対する直接的な結果は見つからなかった。別の苦情は、確立された患者への害なしに改善点をもたらした。[2][7]

これらの区別は不可欠である。「停止中に人々が死亡した」は時間的な記述である。「停止が死亡を引き起こした」は因果的な記述であり、引用された調査はそれを確立しなかった。前者を後者を暗示する文脈で繰り返すことは、証拠を誇張し、公共の理解と法的露出の両方を歪める可能性がある。

不確実性はインシデントを無害にするわけではない。緊急通信は、後の調査が反事実的な結果を再構築できない場合でも、遅延が重要になる可能性がある状況のために設計されている。説明責任のある尺度は曝露である: 何回の通話試行が失敗したか、発信者がどのくらい待ったか、どのような代替手段が利用可能だったか、医療機関が連絡経路を失ったか、対応が他の場合よりも遅れて開始されたか。公開報告書は例と組織的所見を提供するが、完全な通話試行データセットは提供しない。

これは将来のインシデントのための証拠要件を指し示す。事業者と公的機関は、失敗した通話試行、再試行パターン、代替連絡先、派遣タイミングを結びつけることができるプライバシー保護記録を保存すべきである。そのような分析は、緊急通話データが機密であるため、慎重に管理されなければならない。集計数値と管理された調査は、障害が地域、プロバイダー、アクセス技術、または時間によって集中したかどうかを確立できる。

影響測定はまた、到達可能性と応答性を区別すべきである。112にダイヤルする能力の回復は、すべてのキューイングされたまたは再試行された需要が正常に処理されたことを証明しない。逆に、応答のない通話にはルーティングインシデント以外の理由がある可能性がある。目標はすべての結果をネットワークに割り当てることではなく、通常の経路の喪失によって生み出された追加リスクを定量化することである。

KPN が加重ダウンタイムについて表明した懸念は、従来の可用性測定がまさにこの種のイベントを割り引く可能性があるため、関連する。短いが全国的な重要なサービスの失敗は、より重要でない機能のより長い部分的な失敗よりも大きな公共リスクを生み出す可能性がある。したがって、有用なメトリクスは、サービス重要度、影響を受けた人口、クロスオペレーターのリーチ、フォールバックの可用性、エンドツーエンドの成功を回復するために必要な時間を含むべきである。[10]

これらの測定は、インシデントの遡及的記述だけでなく、インシデント前の投資と説明責任に情報を提供すべきである。緊急通話の継続性がより高いリスク重みを受け取る場合、コモンモードテスト、独立フォールバック、継続的なチェーン監視は、エンジニアリングリソースをより効果的に競合する。そのメトリクスは、PR 番号ではなくガバナンスツールになる。

KPN の是正措置はメカニズムに対処したが、証明には受諾以上のものが必要

共同報告書は、KPN が根本原因分析と広範な評価を実施し、Bell Labs コンサルタンシーに委託したと述べている。KPN は2019年8月に行動計画を策定した。報告書は、公表時点でほとんどの措置が実施されていたと述べている。ルーティング要求が大量のエラーメッセージによって妨害されるのを防ぐためのソフトウェア設定調整と、ルーティングプラットフォームが低速化または停止した場合の112トラフィックのためのより迅速な代替チャネルを特定している。[2][7]

これらの措置は障害に合理的に対応している。エラーメッセージの蓄積を防ぐことは増幅に対処する。カウンターと設定の動作を変更することは同期状態に対処する。代替ルーティングはプラットフォームの喪失に対処する。追加の監視は検出に対処する。112を明確な重要サービスとして扱うことは、チェーンにより明確な内部優先順位を与える。

規制当局は、行動計画がネットワークをより堅牢にし、再発リスクを低減すると結論付けた。また、計画的および計画外のソフトウェア設定の脆弱性、変更への耐性、パフォーマンス指標の交換、エンドツーエンドのサービス管理、プロセス規律に十分な注意が払われていなかったことも指摘した。定期的な進捗報告を推奨し、定期的な監督がコンプライアンスを調査すると述べた。[2][7][9]

これらは意味のある監督所見であるが、すべての管理が時間の経過とともに有効であり続けたという公的証拠と同じではない。「実施された」は、設定が変更されたか手順が採用されたことを意味する。「有効」は、管理が関連する障害を防止、検出、または制限することを示すテストを必要とする。「持続」は、さらなるソフトウェアリリース、プラットフォーム移行、人員変更後の証拠を必要とする。

強力な改善記録は、各アクションをテストに結び付けるだろう。カウンター修正は、境界値および同期状態でテストされる。エラー処理は、繰り返しトラフィックと制限付きストレージ条件の下で行われる。代替ルーティングは、プライマリプラットフォームとその管理依存関係が利用できない間に実行される。継続的なエンドツーエンドテストは、すべての発信元事業者をカバーする。監視は、プラットフォームの劣化と実際のコール失敗の両方の検出を示す。危機演習は、単一の国家メッセージと検証済みの非音声代替手段をテストする。

結果には、成功だけでなく失敗も含まれるべきである。決して欠陥を見つけないテストプログラムは、カバレッジが弱い可能性がある。有用な証拠は、何が注入され、どの信号が現れ、どのアクションが続き、トラフィックが利用可能なままだったか、次の演習前に何が修正されたかを記録する。また、制限も記録する: 実験室の負荷は国家規模の再試行を代表しない可能性があり、合成コールは本番で使用されるすべてのハンドオフを実行しない可能性がある。

KPN の年次報告書は、事業者自身の復旧、安定化、改善の説明を提供する。それは、経営陣が何を開示することを選択したか、会社が影響をどのように枠組みしたかを示すために関連する。独立した検証として扱われるべきではない。共同監督報告書とその後の規制当局のフォローアップは別の層を提供するが、それらでさえすべてのテスト結果や内部変更記録を公開していない。[9][10][11][12]

したがって、適切な結論は調整される。公的証拠は、KPN が substantial な是正措置を講じ、規制当局がそれを審査および監視したことを支持する。公的証拠は、再発が不可能になった、すべてのフォールバックが国家負荷で独立して検証された、またはすべての長期残余リスクが排除されたと支持していない。

コンプライアンスは下限であり、アーキテクチャが適切であったことの証明ではなかった

オランダ電気通信法および関連する継続性規則は、公共電子通信ネットワークおよび公共電話サービスのプロバイダーに対して、適切な技術的および組織的措置を講じ、技術的または電力障害中の可用性を最大化し、重要な継続性の中断を報告することを要求していた。オランダの政策はまた、モバイルサービスを通じて112に到達する能力に対処していた。EU レベルでは、欧州電子通信コード第109条が、単一の欧州番号112を通じて緊急サービスへのアクセスを無料で要求していた。[13][14][15][16]

共同調査は、KPN が調査した継続性義務に準拠していることを発見したが、同時に、準拠しているにもかかわらず停止が発生したことを発見した。その組み合わせは重要である。それは2つの単純化された結論を防ぐ。

第一に、インシデント自体は、KPN がすべての該当する継続性規則に違反したという証拠ではない。規制当局は法的義務を評価し、引用された報告書でそのような所見を出していない。責任ある記事は、停止を法的評決に変換すべきではない。

第二に、コンプライアンスは、システムが実際のコモンモード条件に耐えられることを実証しなかった。適切な措置や最大可用性などの一般的な義務は判断を必要とする。それらは、同一ソフトウェア、同期カウンター、エラーストレージ、繰り返し通話、国家的な緊急依存関係の間のすべての相互作用を列挙することはできない。企業は評価されたベースラインを満たし、それでも自社のアーキテクチャに重要な未テストの障害モードが含まれていることを発見できる。

このため、規制上の説明責任には証拠の質を含めるべきである。要件は、継続性ポリシーが存在するかどうかだけでなく、事業者がどのように独立性を確立したか、どのエンドツーエンドテストが実行されたか、変更が緊急ルーティングにどのように影響したか、どの残余リスクが残っているかを尋ねるべきである。答えは依然としてリスクベースであり、絶対的ではない。どのネットワークもゼロ障害を約束できない。しかし、残余リスクを受け入れる決定は、責任ある当局に見えるべきであり、サービスの公共的重要性を反映したテストによって支持されるべきである。

インシデント通知は別の管理である。タイムリーな通知により、規制当局と政府機関は対応を調整し、証拠を保存できる。それは公的指示の代わりにはならない。プロバイダーは、市民が依然として一貫性のない代替手段を受け取っている間に当局に通知できる。法的報告、危機コミュニケーション、技術的復旧は、異なる聴衆を持つ関連しているが別個の義務である。

このイベントはまた、規制が企業の境界ではなくサービスチェーンに従わなければならない理由を示している。他の事業者が通話を発信し、KPN がそれらを112経路に輸送し、警察が応答ドメインを管理し、省庁がチェーン責任を持ち、安全地域が地域的に行動し、医療機関が通信に依存していた。一つのエンティティのみに適用される要件は、インターフェースと共有テストも管理されない限り、エンドツーエンドの保証を作成できない。

規制当局は、安定した指標を要求することでその保証をより監査可能にできる: 発信元別の成功した緊急通話テスト、最大検出時間、フォールバック呼び出し時間、未解決の高リスク変更所見、国家的継続演習の日付。機微な詳細は保護されたまま、傾向と重要な例外が開示される。

したがって、コンプライアンスは必要だが決定的ではない。それは最低限の期待と介入のメカニズムを設定する。2019年の報告書は、説明責任が依然として、実装された管理が実際のアーキテクチャと一致しているかどうか、証拠がルールブックが事前に名前を付けていなかった障害を検出できるかどうかを検討する必要があることを示している。

緊急セッション標準は文脈を提供するが、KPN の正確な設計の証明ではない

ETSI および3GPP 仕様は、IP マルチメディアサブシステム環境での緊急セッションを説明しており、緊急通信を認識、ルーティング、処理するために使用される機能を含む。これらは、現代の音声ネットワークがますますソフトウェアでサービスロジックを実装し、仮想化、複製、集中管理される可能性のある制御機能に依存するため、有用な文脈である。[17]

標準は、KPN の2019年のルーティングプラットフォームが特定の IMS コンポーネント、インターフェース、または展開トポロジーを持っていたと主張するために使用されるべきではない。ソースセットはそのマッピングを確立しない。標準図はインシデントアーキテクチャ図ではない。

有用な教訓は方法論的である。緊急通信は、複数の機能から組み立てられたサービス成果である: 緊急要求の識別、経路の選択、輸送、適切な応答拠点への到達、転送のサポート。一つの機能での冗長性は、別の機能が共通である場合、成果を保証しない。ソフトウェア複製は可用性を高める一方で、同じ欠陥と状態を再現する可能性がある。

仮想化はこの問題をより重要にする。それが、規制当局がネットワーク仮想化の増加を見越してソフトウェアおよび設定エラーのための管理を推奨した理由である。仮想ネットワーク機能は迅速に作成され、ホスト間で移動できるが、コピーは同じイメージ、オーケストレーション、ポリシー、データベース、管理資格情報を共有する可能性がある。物理的な分散は論理的なコモンモードと共存できる。[2][7]

標準コンプライアンスもサービステストの代わりにはならない。コンポーネントは指定されたインターフェースを正しく実装する一方で、ルーティングデータが利用できない、管理状態が破損している、または別の事業者のトラフィックがテストの対象外であるために、本番チェーンが失敗する可能性がある。相互運用性テストは一種の保証を確立する。継続的なエンドツーエンド監視は別の保証を確立する。

したがって、標準の文脈は質問を明確にするが、それらに答えるわけではない。KPN の通話経路にはどの機能があったか?4つのルーティングシステムに共通していた機能はどれか?どの状態が共有されていたか?改善後にそれらの機能をバイパスする代替経路はどれか?公開記録は広範なルーティングプラットフォームのメカニズムを答えるが、完全な実装インベントリは答えない。

この境界は技術的正確性を保護する。標準用語を使用して説明を正確に聞こえさせるのは簡単だろう。ソースがその用語をインシデントに結び付けない限り、誤った自信を生み出す可能性がある。正しい使用方法は、緊急サービスが機能の連鎖に依存する理由と、複製されたソフトウェアがコモンモード管理を必要とする理由を説明し、KPN の正確な未公開トポロジーは未解決のままにすることである。

説明責任は予防、検出、封じ込め、証明に対する制御に従う

停止の責任は分散されていたが、曖昧ではなかった。各アクターは、予防、検出、封じ込め、コミュニケーション、復旧、検証の特定可能な部分を管理していた。

管理領域主な実務管理者期待される証拠
ルーティングプラットフォームのアーキテクチャKPN依存関係マップ、障害ドメイン分析、コモンモードテスト結果、変更記録
カウンターおよび長時間実行状態の安全性KPN および該当サプライヤー境界テスト、警告制御検証、リセットロジック、是正措置の所有権
エラー増幅と過負荷KPN制限付きログ、再試行負荷テスト、背圧動作、サービスレベルアラーム
112代替ルーティングKPN とチェーン当局フォールバックが失敗した依存関係をバイパスする証明、容量テスト、起動記録
クロスオペレーター配信KPN、他の事業者、チェーン当局すべての発信元ネットワークおよびアクセスクラスからのエンドツーエンド通話テスト
国家112ガバナンス法務・安全大臣および警察管理者現在のアーキテクチャ所有権、決定権、演習記録、エスカレーション基準
地域フォールバック運用警察および25の安全地域スタッフ配置場所の手順、検証済み代替手段、訓練、演習結果
医療継続性救急、一般開業医、病院、地域保健機関シナリオプレイブック、独立した通信能力、スタッフの精通
NL-Alert 技術配信KPN および他のモバイル事業者継続的な非破壊監視、設定テスト、配信証拠
危機メッセージガバナンス省庁、警察、安全地域単一メッセージ権限、検証済み番号、タイミング記録、訂正手順
法的監視とフォローアップオランダ監督当局進捗報告、検査所見、残余リスク決定、クロージャ証拠

このマップは2つの反対の誤りを防ぐ。一つは、政府や地域団体がメッセージ内容と実行を管理していたにもかかわらず、すべての混乱した公的メッセージについて KPN を非難することである。もう一つは、ルーティング障害をチェーン全体に拡散させ、プラットフォームに対して責任を負うアクターが誰もいなくなることである。KPN は通話ルーティングシステム、その変更プロセス、監視、技術的フォールバックを実際に管理していた。その責任は、他のアクターにも継続性の義務があった場合でも、特定されたままである。

制御はまた、合理的に要求できる証拠を決定する。市民はプラットフォームカウンターログを生成できない。他の事業者は KPN の4つのシステムがどのように状態を管理したかを独立して証明できない。KPN はすべての安全地域がスタッフを訓練したことを証明できない。各管理者はその権限内の記録を提供すべきであり、チェーン所有者はそれらをエンドツーエンドのケースにまとめる。

サプライヤーは技術的責任を共有する可能性があるが、利用可能な情報源は該当するソフトウェアまたは設定の責任者を特定していない。証拠なしにベンダー障害を割り当てるのは不適切であろう。契約は、重要なプラットフォームをテストおよび監視する KPN の運用責任を排除しない。事業者の管理は、KPN がすべての欠陥コンポーネントを作成したことを自動的に証明するものではない。

規制当局の役割は、単に推奨事項が受け入れられたと宣言することではない。リスク管理が測定可能かどうか、進捗報告が現在のシステムに結びついているかどうか、主要な変更がクローズされた所見を再開するかどうかをテストできる。ルーティングプラットフォームが交換された場合、古いプラットフォームのみに結び付けられた改善証拠は、もはやサービスを保証しないかもしれない。監視は継続的な緊急機能に従うべきである。

このアプローチはまた、説明責任を建設的にする。管理が改善される前に罰する人物を特定する必要はない。誰が条件を変更できたか、誰がそれを見ることができたか、誰が影響を制限できたか、誰が修理を検証できるかを問う。それらの答えが欠けている場合、欠如自体がガバナンスの所見である。

信頼できるクローズアウトは時間の経過にわたる独立性を示すだろう

公開記録はメカニズムと一連の応答を確立している。残る疑問は、リスクのクローズを正当化するものは何かである。

第一に、KPN は現在のアーキテクチャ証拠を必要とする。それには、通常の112経路、代替経路、管理依存関係、ルーティングデータソース、他の事業者からのトラフィックが使用する収束点が含まれる。目的は機微なネットワーク設計図を公開することではない。それは、許可されたレビューアがフォールバックが失敗したプラットフォームと状態を回避するかどうかをテストできるようにすることである。

第二に、事業者は変更証拠を必要とする。カウンターを同期させたサービス管理更新と警告スクリプトエラーは、なぜ機能リリーステストが不十分であったかを示している。レビューは、長時間実行状態、境界値、レプリカ間の同期、アップグレード後の古い状態の動作をカバーすべきである。また、緊急継続性証拠が不完全な場合にリリースを停止できる者を確立すべきである。

第三に、チェーンは繰り返されるエンドツーエンドテストを必要とする。改善後の1回の成功テストは、経路が一度機能したことを示す。それは、すべての事業者、アクセス技術、フォールバックが後の変更後もカバーされ続けたことを示さない。継続的または頻繁なテストは、制御された合成コールで、回帰を検出できる。定期的な国家演習は、合成コールではテストできない組織層をテストできる。

第四に、フォールバック証拠は現実的な障害注入を必要とする。プライマリプラットフォームは、制御された環境または演習で利用不能にされるべきである。管理サービス、ルーティングデータ、通常の通信も、安全な場合には制約されるべきである。代替経路は代表的な負荷を運ぶべきであり、応答者はインシデント中に利用可能な同じ権限とツールを使用してそれを起動すべきである。

第五に、公共コミュニケーションはインフラとして演習されるべきである。メッセージテンプレートは、失敗した経路を共有しない検証済みの代替手段を必要とする。国家および地域のアクターは、競合する番号と警報混雑を防ぐプロセスを必要とする。スタッフは、1つの国家指示がいつ優先され、訂正がどのように伝播するかを知るべきである。

第六に、影響指標は社会的サービスを反映すべきである。可用性、成功したコール完了、検出時間、フォールバック起動時間、影響を受けた人口、クロスオペレーター範囲は、パフォーマンスの全体像に属する。KPN の加重ダウンタイムに関する懸念は、通常のネットワークメトリクスが重要なサービス影響を捉えない可能性があるという有用な認識であった。[10]

第七に、独立したフォローアップは残余リスクを記録すべきである。一部のコモンモード条件は、排除ではなく低減される可能性がある。レビューアは、どの依存関係が残っているか、なぜ受け入れられるか、何がそれらを検出するか、決定がいつ再検討されるかを述べるべきである。沈黙はゼロリスクと解釈されるべきではない。

後の規制当局報告書は、KPN が推奨事項を受け入れ、フォローアップが監視されたと述べている。それは継続的な監視の説明を支持する。利用可能な公開パケットには、すべての定期的な進捗報告や現在のテスト結果は含まれていない。したがって、正しい結論は改善が失敗したということではなく、公的証明が不完全であるということである。[9]

この基準は2019年のイベントにとって要求が厳しいように見えるかもしれない。しかし、サービスは永続的である。緊急ネットワークは、仮想化、サプライヤー変更、プラットフォームアップグレード、新しいアクセス技術を通じて進化する。あるインシデントの直後に説得力があった証拠は、古くなる可能性がある。クローズアウトは、一度きりの宣言ではなく、維持された保証プロセスでなければならない。

どのような新しい証拠がこの評価を変える可能性があるか

いくつかの結論は、追加の記録が利用可能になれば、より強固になるか、より狭くなる可能性がある。

完全なプラットフォームログは、カウンターアラインメントからエラー蓄積までの正確なシーケンスを確立し、可視トラフィック減少前にアラームが発報したかどうかを示す可能性がある。ソフトウェア変更および承認記録は、どのテストが要求され、どのチームがリスクを管理したかを特定できる。サプライヤーの根本原因分析は、推測なしにコンポーネントの所有権を明確にできる。

インシデント前および改善後のフェイルオーバーテストは、6月24日より前に代替経路が存在したかどうか、およびその後その独立性がどのように変化したかを示すことができる。エンドツーエンド記録は、事業者、固定およびモバイルアクセス、応答拠点、地域転送にわたるカバレッジを確立できる。容量演習は、フォールバックが再試行需要を処理できるかどうかを示すことができる。

通話試行および完了データは、影響測定を改善できる。適切に保護されれば、何回の通話が失敗したか、再試行行動がどのように進化したか、サービスが均一に戻ったかどうかを示すことができる。医療セクターの記録は、報告書の個別結果に関する注意を保持しながら、運用遅延を明確にできる。

定期的な規制当局の所見は、KPN が行動計画を完了したかどうか、管理がその後の変更後も有効であり続けたかどうか、どの残余リスクが受け入れられたかを示すことができる。集約された公開指標は、機微な詳細を露出させずに保証を提供できる。

証拠はまた、責任を狭める可能性がある。サプライヤー契約と技術記録が、合理的なテストにもかかわらずコンポーネントが仕様に反して動作したことを示した場合、サプライヤーの説明責任はより具体的になる。内部記録が、既知の警告の失敗が緩和なしに受け入れられたことを示した場合、経営陣の責任はより具体的になる。現在の情報源セットはどちらの主張も支持していない。

したがって、評価は端が暫定的で中心が確固たるままでなければならない。停止期間、国家依存、広範な音声影響、継続的なインターネット可用性、4システムコモンモード、失敗したカウンター警告、別の NL-Alert メカニズム、準備のギャップは十分に支持されている。個別の因果関係、ベンダーID、内部決定所有権、完全な長期的有効性は未解決のままである。

結論: ネットワークの回復力は共有経路を生き残らなければならない

KPN の停止は、オランダの通常の緊急通報経路が一つの事業者のルーティングプラットフォームに収束したため、公共安全の説明責任テストとなった。4つのルーティングシステムは、ソフトウェア状態が同期した後、有用な障害ドメインを提供しなかった。予防警告はカウンターが境界を越えるのを止めなかった。繰り返される通話需要はエラー作業を増幅した。ルーティングプラットフォームは通話転送を停止し、障害は他の事業者からの112トラフィックに達した。

インシデントはまた、技術的復旧は継続性の一部にすぎないことを示した。別の NL-Alert 障害が一つの警告チャネルを損なった。政府および地域の計画は一貫して運用可能ではなかった。代替番号と指示は異なっていた。医療機関は即興と必ずしも習熟していない通信ツールに依存した。これらは異なる管理者を持つ別個の障害であったが、公共の経験の中で結合した。

KPN の是正措置はメカニズムの重要な部分に対処し、規制当局はフォローアップを確立した。その証拠は、却下も確実性も支持しない。それは検証アジェンダを支持する: ルーティングフォールバックが失敗した仮定を回避することを証明し、マルチオペレーターの112チェーン全体を継続的にテストし、プラットフォーム状態だけでなくサービス成果を監視し、再試行増幅を制限し、公的代替手段をリハーサルし、すべての重要な変更後に証拠を維持する。

説明責任は制御に従うときに最も明確である。KPN はプラットフォームとその技術的修理を管理した。他の事業者は、共有経路に対する認識とテストを管理した。警察と省庁は国家チェーンを管理した。安全地域と医療機関はローカル継続性を管理した。規制当局は証明の基準とフォローアップを管理した。

永続的な教訓は、4つのシステムにもかかわらず冗長性が失敗したということではない。それは、冗長性がコンポーネントレベルで数えられている一方で、リスクが共有状態とサービスチェーンレベルで蓄積されていたことである。緊急ネットワークインフラにとって、独立性はアーキテクチャ図のラベルではない。それは、すべての通常の経路が一緒に失敗する可能性がある正確な条件下で実証される成果である。

出典

  1. https://www.rdi.nl/documenten/2020/06/25/onbereikbaarheid-van-112-op-24-juni-2019
  2. https://www.rdi.nl/site/binaries/site-content/collections/documenten/2020/06/25/onbereikbaarheid-van-112-op-24-juni-2019/Gezamenlijk%2Brapport%2B112%2BAT%2BIJenV%2Ben%2BIGJ%2Bonbereikbaarheid%2Bvan%2B112%2Bop%2B24%2Bjuni%2B2019.pdf
  3. https://www.inspectie-jenv.nl/actueel/nieuws/2019/06/26/onderzoek-naar-storing-112
  4. https://www.inspectie-jenv.nl/actueel/nieuws/2019/08/22/plan-van-aanpak-onderzoek-112-gepubliceerd
  5. https://www.inspectie-jenv.nl/actueel/nieuws/2020/06/25/overheden-en-organisaties-niet-voldoende-voorbereid-op-landelijke-uitval-112
  6. https://www.inspectie-jenv.nl/documenten/2020/06/25/rapport-onbereikbaarheid-van-112-op-24-juni-2019
  7. https://www.inspectie-jenv.nl/site/binaries/site-content/collections/documents/2020/06/25/inaccessibility-of-emergency-services-number-112-on-24-june-2019/Inaccessibility%2Bof%2Bemergency%2Bservices%2Bnumber%2B112%2Bon%2B24%2BJune%2B2019.pdf
  8. https://www.inspectie-jenv.nl/actueel/nieuws/2020/07/02/veiligheidsregio%E2%80%99s-beter-voorbereid-op-crises-maar-nog-stappen-te-zetten
  9. https://www.rdi.nl/site/binaries/site-content/collections/documenten/2021/05/26/jaarbericht-2020/Jaarbericht%2BAgentschap%2BTelecom%2B2020.pdf
  10. https://ir.kpn.com/files/doc_financials/2019/ar/Integrated_Annual_Report_2019.pdf
  11. https://ir.kpn.com/news-and-events/events/event-details/2020/KPN-Annual-Report-2019/default.aspx
  12. https://ir.kpn.com/news-and-events/news/news-details/2020/Publication-of-KPNs-Integrated-Annual-Report-2019-02-24-2020/default.aspx
  13. https://wetten.overheid.nl/BWBR0009950/2020-12-21/0/
  14. https://wetten.overheid.nl/BWBR0032149
  15. https://wetten.overheid.nl/BWBR0043937/
  16. https://eur-lex.europa.eu/legal-content/EN/TXT/?qid=1657563539506&uri=CELEX%3A32018L1972
  17. https://www.etsi.org/deliver/etsi_ts/123100_123199/123167/14.05.00_60/ts_123167v140500p.pdf
  18. https://www.inspectie-jenv.nl/site/binaries/site-content/collections/documents/2019/08/22/plan-van-aanpak-crisiscommunicatie-112/Plan%2Bvan%2Baanpak%2Bcrisiscommunicatie%2B112%2Bdef%2Bpublieksversie.pdf