要約

  • 管理インターフェースが本番通信と同じ通信事業者、管路、電源、認証基盤、承認経路に依存しているなら、それは独立した復旧手段ではない。
  • 停止の影響に見合う独立性を選び、本番経路を実際に使えない状態にして、コンソール接続から設定復元、変更、ロールバックまでを試す必要がある。

地方の集約拠点で光ファイバーが切れたとする。加入者通信が止まる。それと同時に、NOC の監視画面は更新を止め、SSH セッションは切れ、自動化基盤も切替設定を送れなくなる。ルーターは動いているかもしれない。予備回線もあるかもしれない。しかし、確認も操作もできない。

このとき失われたのは帯域だけではない。障害の内部へ命令を届ける手段である。

RFC 4778 は、本番データと同じ経路を使うインバンド管理と、別経路を使うアウトオブバンド管理を区別している。RFC 3871 は、インバンド方式には追加回線が不要という利点がある一方、顧客回線の輻輳、公開インターフェースの障害、ソフトウェア不具合によって管理不能になり得ると述べる。現在の CISA の通信インフラ向け指針は、管理網を本番データフローから物理的に分離し、専用管理端末と厳しいアクセス制御を用いるよう勧めている。

「別ポート」と「別障害領域」は違う

コンソールポートの存在だけを見てはいけない。運用者から装置まで、依存関係を一本ずつたどる。コンソールサーバーは顧客回線と同じ事業者を使っていないか。二本のファイバーは同じ管路を通っていないか。携帯回線も同じ地域停電で止まらないか。中央の認証サービスに届かなくてもログインできるか。正常な設定は障害の外から取得できるか。現地担当者は施設へ入り、変更を実施する権限を持つか。

一つでも共通依存があれば、構成図上の二経路が実運用では一つの故障点になる。

NSA はアウトオブバンド設計を費用と防御の幅として説明する。物理分離は最も強いが、追加の機器、配線、インターフェース、保守が必要だ。VLAN、VRF、VPN による論理分離は安価だが物理回線を共有するため、断線、停電、共通シャーシ障害には耐えないことがある。同じ名称で呼んでも、生き残る障害は同じではない。

ローカル制御は、到達性、資格情報、信頼できる設定、物理アクセス、判断権限の五つで成り立つ。一つ欠けるだけで、残り四つは役に立たなくなる。

復旧口を攻撃口にしない

常時利用できるコンソール経路は復旧を速めるが、攻撃面も増やす。インターネットへ直接公開されたモデムと共通パスワードは、可用性対策ではない。CISA はデフォルト拒否、専用管理端末、管理装置間の横移動防止を求める。NSA は暗号化されたプロトコルを使い、管理インターフェースを直接インターネットへ出さないよう勧める。豪州政府のゲートウェイ運用指針も、データプレーン障害時に管理アクセスを維持するための専用管理網を示している。

目標は「狭い到達性」だ。本番網が消えたときに許可された運用者は入れるが、顧客端末、一般業務 PC、侵害済みの別装置は同じ経路を横移動に使えない。

設定の保管場所も障害から切り離す必要がある。CISA は設定を中央で保管し、装置自身を唯一の正として扱わないよう勧めている。コンソールがあっても、検証済み設定、ソフトウェアイメージ、構成図、戻し手順がなければ、現場は障害を近くで眺められるだけだ。逆に、同じ認証基盤やストレージ障害の内側にあるバックアップも復旧資産ではない。

重要度に応じて独立性を買う

保守拠点に近い小規模なアクセス装置なら、安全な現地コンソール、保護された設定、訓練済みの出動手順で十分かもしれない。病院、産業団地、地域唯一の接続を支える遠隔集約拠点なら、別事業者の回線、独立した携帯・無線管理、コンソールサーバー、予備電源の費用は、視界を失う一時間より安い可能性がある。

評価すべきは通信停止額だけではない。診断できない時間、移動時間、希少な専門家の工数、契約上の損失、公共サービスへの影響、焦った作業で二次障害を起こす確率も含める。その総額を、独立経路の月額費用と、パッチ適用・監視・訓練の負担と比較する。

試験は「本番トランスポートは利用不可」と宣言して始める。復旧経路で接続し、隠れた依存なしに認証し、承認済み設定を取り出し、限定的な変更を行い、結果を確認し、元へ戻す。正常な社内網から予備回線へ ping を送るだけでは証明にならない。

情報源