摘要

  • 新增的是 TGW 跨区域对等连接上的合成探测归因,AWS 对指标覆盖终点作了明确限定。
  • 没有观察到 AWS 网络异常,不代表远端业务正常;监控服务也不自动切换网络。

网络故障有时并不缺曲线,而是缺一个大家愿意接手的结论。应用团队看到请求变慢,网络团队却拿不出同一时段的异常证据,工单便在交接中消耗时间。AWS 于 9 月 10 日扩展 CloudWatch 合成探测的网络健康指标 NHI,为这类讨论增加了一项依据。不过,发布公告说的是经过 Transit Gateway 跨区域对等连接的路径,指标反映的范围到该对等连接为止。它没有为远端应用的完整服务过程背书。

先辨认产品,才能辨认证据。这次更新属于合成探测;AWS 在2025 年 9 月的另一份公告中已经为流量监测加入跨区域可见性。把两个功能都简称为“CloudWatch 能看跨区域网络”,容易把旧能力当新新闻,也容易把一种监测方式的判断依据套到另一种上。

本次尤其值得关注的,是一个零值该如何被使用。合成探测工作原理将 NHI 定义为 0 或 100:100 表示在 AWS 控制的路径内观察到网络性能下降,0 表示没有观察到相应下降。这既不是用户成功率,也不是业务请求失败比例。对于范围之外的路径和应用环节,一个零不能直接给出结论。

探测本身同样有边界。ICMP 回应或 TCP 建连回应,可以成为往返时延和丢包的测量依据;它们不是完成付款、执行查询或通过身份认证的记录。若业务仍然报错,运营者还须对照实际负载的路径、时间与应用日志。把传输层有回应理解为业务已恢复,会让一张正常的面板掩盖仍未解决的问题。

观测还需要积累数据。新建监测器、新增探针或重新启用探针后,NHI 可能延迟数小时才出现。这不是精确的交付时限,更不是立即可用的判决。把没有数据的状态填成 0,会在最需要解释的时候,混淆“尚无观察结果”和“未观察到异常”。

采购方因此买的不是一个统一的“健康标签”,而是一组特定路径的持续证据。计费说明列出受监测资源的小时费用及 CloudWatch 指标费用,源子网决定资源覆盖。减少覆盖可能减少支出,也可能让行为不同的一条关键路径退出视野。账单应与覆盖的代表性共同审视,而不能只比较指标数量。

还有一个不能省略的交接:服务限制明确说明,Network Synthetic Monitor 不提供自动网络故障切换。告警可以推动调查,却不会替企业准备替代路径,也不会授权搬移业务。公告没有证明实际修复时间缩短多少,更没有证明买下监控就能按固定比例节省故障成本。