要約

  • TGW のリージョン間ピアリングを通る合成監視に NHI が加わったが、説明された AWS 側の観測範囲はピアリング接続までである。
  • ゼロは範囲内で劣化を観測しなかったことを示す。アプリケーションの正常性を保証せず、自動切り替えも行わない。

障害対応の引き継ぎでは、「こちらの監視は正常です」という一言が重くなる。相手のアプリケーションがまだ遅くても、その言葉だけで担当が決まりかねない。AWS が9月10日に発表した CloudWatch の機能拡張は、その判断に使える材料を増やす。ただし、材料の届く範囲も一緒に読む必要がある。

今回の発表では、Transit Gateway のリージョン間ピアリングを通る経路について、合成監視のネットワーク健全性指標 NHI を提供する。AWS ネットワークの状態を示す範囲は、ピアリング接続までとされる。遠隔地のアプリケーションで一連の処理が完了した、という証明ではない。

機能名の整理も欠かせない。CloudWatch のフロー監視には2025年9月にリージョン間の可視化が追加されていた。2026年のニュースは合成監視の対象拡大である。両方を単に「リージョン間監視」と呼ぶと、障害記録に残した証拠がどの方法で得られたのか分からなくなる。

合成監視の動作説明で NHI が取る値は 0 と 100 だ。100 は AWS の管理する経路内で劣化を観測したこと、0 はそのような劣化を観測しなかったことを意味する。顧客の成功率やリクエストの失敗割合を表す数値ではない。対象外の区間に関して、ゼロだけで結論を出すこともできない。

往復遅延とパケット損失の測定には、ICMP の応答や TCP 接続確立時の応答を使う。それらは通信の切り分けに役立つが、決済、データベース照会、認証済みセッションの完了とは異なる。プローブに応答が返った後にも業務の失敗は残り得る。アプリケーション側の記録と、実際の経路・時間帯が対応しているかを調べる仕事はなくならない。

観測の準備期間にも注意したい。監視を新設したときや、プローブの追加・再有効化後には、データ収集のため NHI の提供まで数時間かかる場合がある。正確な時間を保証する記述ではない。まだ値がない状態をゼロとして記録すれば、「未観測」と「異常を観測しなかった」を混同することになる。

購入する範囲も判断の質に影響する。料金の説明は、監視対象リソースの時間料金と CloudWatch メトリクスの料金を分け、送信元サブネットを対象リソースとしている。監視範囲を減らせば支出を抑えられる可能性はあるが、別の振る舞いをする重要経路を見なくなる可能性もある。メトリクスの本数だけでは買い物の良しあしを測れない。

さらに、サービスの制約にはネットワークの自動フェイルオーバーを提供しないと明記されている。アラームは調査のきっかけであり、代替経路の用意やトラフィック移動の承認ではない。今回の発表だけで、実際の復旧が何分短縮されるか、どれだけ節約できるかは分からない。