摘要
- 新增的是 TGW 跨区域对等连接上的合成探测归因,AWS 对指标覆盖终点作了明确限定。
- 没有观察到 AWS 网络异常,不代表远端业务正常;监控服务也不自动切换网络。
网络故障有时并不缺曲线,而是缺一个大家愿意接手的结论。应用团队看到请求变慢,网络团队却拿不出同一时段的异常证据,工单便在交接中消耗时间。AWS 于 9 月 10 日扩展 CloudWatch 合成探测的网络健康指标 NHI,为这类讨论增加了一项依据。不过,发布公告说的是经过 Transit Gateway 跨区域对等连接的路径,指标反映的范围到该对等连接为止。它没有为远端应用的完整服务过程背书。
先辨认产品,才能辨认证据。这次更新属于合成探测;AWS 在2025 年 9 月的另一份公告中已经为流量监测加入跨区域可见性。把两个功能都简称为“CloudWatch 能看跨区域网络”,容易把旧能力当新新闻,也容易把一种监测方式的判断依据套到另一种上。
本次尤其值得关注的,是一个零值该如何被使用。合成探测工作原理将 NHI 定义为 0 或 100:100 表示在 AWS 控制的路径内观察到网络性能下降,0 表示没有观察到相应下降。这既不是用户成功率,也不是业务请求失败比例。对于范围之外的路径和应用环节,一个零不能直接给出结论。
探测本身同样有边界。ICMP 回应或 TCP 建连回应,可以成为往返时延和丢包的测量依据;它们不是完成付款、执行查询或通过身份认证的记录。若业务仍然报错,运营者还须对照实际负载的路径、时间与应用日志。把传输层有回应理解为业务已恢复,会让一张正常的面板掩盖仍未解决的问题。
观测还需要积累数据。新建监测器、新增探针或重新启用探针后,NHI 可能延迟数小时才出现。这不是精确的交付时限,更不是立即可用的判决。把没有数据的状态填成 0,会在最需要解释的时候,混淆“尚无观察结果”和“未观察到异常”。
采购方因此买的不是一个统一的“健康标签”,而是一组特定路径的持续证据。计费说明列出受监测资源的小时费用及 CloudWatch 指标费用,源子网决定资源覆盖。减少覆盖可能减少支出,也可能让行为不同的一条关键路径退出视野。账单应与覆盖的代表性共同审视,而不能只比较指标数量。
还有一个不能省略的交接:服务限制明确说明,Network Synthetic Monitor 不提供自动网络故障切换。告警可以推动调查,却不会替企业准备替代路径,也不会授权搬移业务。公告没有证明实际修复时间缩短多少,更没有证明买下监控就能按固定比例节省故障成本。
会员简报
档案背景详情
使用相应会员等级登录,即可解锁完整简报与来源注释。
仅限 Strategic Circle
Strategic Circle
所有读者均可浏览。加入并登录后可解锁档案简报。
加入 Strategic Circle仅限 Leadership Alliance
Leadership Alliance
符合条件的 IP 资产所有者和管理层可登录查看 Leadership Alliance 简报。
加入 Leadership Alliance
