摘要

  • 在 2018 年 12 月 27 日清晨,位于丹佛的一个节点中的交换模块生成了四个异常管理数据包,并传播到 CenturyLink 其中一条长途光传输网络上。CenturyLink 与设备供应商 Infinera 未能确定这些数据包究竟如何或为何生成。[1]
  • 受影响的节点包含一条默认启用的专有节点间管理通道。CenturyLink 知道该通道存在,但未对其进行配置或使用。数据包特征使异常流量绕过了基于大小的过滤器,并在没有过期时间的情况下循环传播。[1]
  • 每个已连接的节点都会重新传输广播数据包,形成反馈循环,消耗处理器容量,破坏线路模块之间的同步,损害客户流量,并阻止正常的远程管理。[1]
  • 移除源模块并未结束事件,因为已在网络内部的数据包继续复制。工程师必须停止数据包确认、禁用管理通道、重新对齐线路模块、恢复远程可见性,并重置或更换受影响硬件。[1]
  • 美国联邦通信委员会描述了一次近 37 小时、影响多个州的断网事件,对全国语音、IP 和传输造成影响。报告中的用户、呼叫、电路和容量数字采用不同分母,不能合并为“失去所有服务的人数”的单一计数。[1][2]
  • 应急呼叫影响超出 CenturyLink 直接承担的 911 角色,因为其他运营商和 911 提供商从受影响网络购买了传输服务。一些主用和备份路径共享 CenturyLink,而独立提供的路径继续正常工作。[1]
  • 华盛顿州从 CenturyLink 的 ESInet I 向 Comtech 的 ESInet II 迁移,产生了一种独特依赖:为 47 个已完成迁移的公共安全应答点提供服务的四条电路全部依赖 CenturyLink 的 Green Network。后来的法院陈述称,拨打这些中心的超过 13,000 次呼叫失败。[3][4][8][9]
  • FCC 的纠正记录集中于具体控制措施:禁用未使用的功能、针对预期管理流量进行过滤、监管无效数据包、审计处理器和内存告警、保留失去正常监测时的修复程序,并改进通知。[1][2]
  • 问责跟随实际控制。CenturyLink 控制网络配置、功能清单、监测、现场接入以及许多传输依赖。Infinera 控制产品默认值、固件行为和文档。运营商、911 供应商和公共机构控制部分电路采购、多样性验证、升级和监督。
  • 公开记录支持对管理隔离和连续性进行分析。它不能证明存在故意行为、破坏、犯罪行为、完整的客户损失总数,也不能证明每一起被报告的个人伤害都源于某一次失败的呼叫。

四个数据包就足以暴露真正的故障域

大型基础设施故障经常用暗示规模的单位来描述:数千台设备、数百万用户、全国性网络。CenturyLink 2018 年 12 月断网事件的直接触发因素要小得多。FCC 发现,丹佛一个光节点中的交换模块生成了四个异常管理数据包。这些数据包不承载普通客户流量。它们属于网络设备用来协调行为的控制环境。它们的重要性来自网络在它们出现之后允许它们做什么。[1]

每个异常数据包都组合了使传播异常具有破坏性的特性。它使用广播目标地址,因此连接的设备将其视为发往每个相邻节点的流量。它的头部和校验和看起来有效。它没有过期时间。它还长于 64 字节,使其能够通过一个拒绝小于或等于该大小数据包的过滤器。这些数据包进入专有的节点间管理通道,被已连接的节点接受,并重新传输给所有相邻节点,包括副本的来源节点。这一循环在没有过期边界的情况下重复进行。[1]

这一机制比数据包数量本身更重要。当控制系统的传播规则、信任假设和资源限制过于宽泛时,它可以将罕见的组件故障放大。数据包在创建时不必数量众多,因为网络在每一步都会制造额外的工作。重复传输消耗了处理容量。节点失去内部同步。线路模块无法可靠协调。用于长途传输的设备变得无法路由和传输普通流量。管理路径不再只是一个单独的行政细节;它成为客户服务失效的通道。

因此,这一事件难以被简单描述为一块坏卡。硬件可以通过许多方式出现故障,却不会引发全国性断网。更有意义的问题是,为什么一个模块能够发出通过现有检查的数据、进入一条未使用但已启用的管理路径、无限循环、耗尽连接节点,并移除工程师诊断问题所需的远程可见性。这一系列事件确定了塑造爆炸半径的控制措施。

FCC 的报告没有说明 CenturyLink 或 Infinera 是否知道异常数据包是如何生成的。在公开记录中,Infinera 无法重现生成机制。这种不确定性应当保持可见。问责并不要求在证据之外虚构原因。它可以审视网络是否对意外的管理流量设有合理边界,即使确切的组件故障是全新的。

这种区分在复杂系统中很重要。工程团队无法预先列举每一种可能的缺陷。他们可以设计限制,阻止未知缺陷演变为无界网络事件。过期时间、严格允许列表、速率限制、资源隔离、禁用未使用的路径、次级可观测性以及带外接入都是这类限制的例子。2018 年 12 月的事件提供了一份异常具体的记录,说明当其中若干边界缺失或不足时会发生什么。

受影响网络是传输基础设施,不是孤立服务

当时 CenturyLink 运营六张分别管理的长途网络。断网影响了其中一张网络,该网络由 Infinera 供应的节点构建的光纤传输网络。流量在节点进出。线路模块在全国范围连接节点。交换模块在每个节点内部将入站和出站线路模块之间的数据转移。内部同步对于这些组件沿预定路径发送流量是必要的。[1]

该架构承载多种服务类型。FCC 列出了用于 911 的高速数据传输、互联网语音协议、本地和长途语音、以太网、IP 骨干服务、消费者 DSL、企业通信以及由其他提供商购买的传输服务。因此,光层故障可能表现为多种不同的客户症状。一位用户可能听到快速忙音。另一位用户可能收到错误提示。政府办公室可能失去电话服务。运营商可能失去中继或位置信息路径。宽带连接可能仍然存在,但质量下降。

这种分层使事件计数难以解读。单一传输故障可以同时影响呼叫、电路、用户、网络容量和下游提供商。这些度量指标不可互换。提供商对潜在受影响用户的估计并不能证明每一位用户都曾尝试呼叫或失去了所有服务。对受阻呼叫的估计可能包括普通语音流量,不能描述为失败的紧急呼叫数量。电路中断可能在不丢弃每一次呼叫的情况下降低冗余。容量估计表达的是传输规模,而不是客户体验。

FCC 报告保留了这些区分,但标题可能模糊它们。CenturyLink 估计超过 1200 万次呼叫被阻断或质量下降。报告还描述了通过其他提供商受到潜在影响的数百万用户,以及非常大量的受影响光容量。另外,它还列出了已知失败的 911 呼叫和自动位置信息丢失。负责任的报道不应选择最大数字并将其附加到最严重的伤害上。

基础设施角色也解释了为什么责任跨越公司边界。CenturyLink 控制受影响的长途网络,但许多使用该网络的服务由其他公司或公共机构运营。这些组织并不控制 CenturyLink 的专有管理通道。它们确实控制一些采购、路径多样性、监测、升级和客户沟通决策。断网使这些依赖记录在运营上变得重要。

网络基础设施问责在遵循这种依赖链时最强。问题不仅仅是消费者账单上出现哪个品牌。还包括哪个组织控制故障组件、哪一方选择底层传输、备用路径是否真正独立、每一方能观察到什么,以及如何验证服务恢复。FCC 和华盛顿州的记录在若干层面提供了证据,但并未证明每一个合同或工程细节。

一条已启用但未使用的管理通道成了传播路径

专有管理通道具有合法的设计目的。它旨在支持快速自动重路由,让线路模块无需等待普通管理指令即可与连接的节点通信。Infinera 提供了这项默认启用的功能。CenturyLink 知道该功能,但未对其进行配置或使用。通道在受影响网络内部仍然可用。[1]

未使用并不意味着无作用。一项仍处于启用状态的功能会参与系统的攻击面和故障面,即使运营商在日常工作中并不依赖它。该通道仍按照其实现的规则接受流量。它的过滤器关注数据包大小。网络管理数据包预期恰好为 64 字节,分片预期更小。异常数据包更大,保留看似有效的字段,并通过了过滤器。过滤器编码了一种关于已知坏流量的假设,而不是对允许流量的严格定义。

FCC 后来建议关闭未使用的系统功能。这一建议很具体,但问责原则更广泛。运营商需要一份当前的功能清单,区分已安装、已启用、已配置、实际使用、受监测和归属状态。供应商默认值不是永久运营决策。一旦设备进入生产网络,运营商就必须决定每个已启用能力是否属于预期设计,以及如何对其加以控制。

供应商承担相应的角色。默认值塑造设备到达客户时的状态。文档应当解释未使用功能的安全影响,而不仅仅是它们的功能目的。产品设计可以要求显式激活、将能力限定于已知对等方、施加保守的传播边界,并在意外路径被激活时生成遥测数据。随后,Infinera 为 CenturyLink 的新节点禁用了该通道,并更新手册,建议在未使用时禁用它。[1]

这一事件并不能证明每一个已启用的默认值都是疏忽,也不能证明所有可选功能都应当始终默认关闭。网络设备有时需要保持可用性的运营安全默认值。证据支持一个更窄的结论:实际的默认值和过滤器组合允许意外管理流量在一个后果严重的故障域中传播,而运营商并未使用该功能。这足以使功能状态治理成为一个合理的问责问题。

一份可辩护的控制记录应当显示:通道何时在清单中被发现、谁接受了其启用状态、审查了哪些威胁和故障假设、哪些节点共享该通道、哪些遥测覆盖它,以及配置最近一次验证的时间。如果组织认定保持启用是必要的,记录应当显示补偿性控制。如果没有任何负责人能够回答这些问题,问题就在于对运行系统的治理,而不是对罕见数据包的事后反思。

这正是运行代码证据重要的地方。一张图可能显示六张分别管理的网络、许多节点以及冗余传输。12 月的事件表明,一个管理功能连接了足够的设备,足以在单张网络内产生全国性影响。实际的传播路径,而不是对功能的预期描述,揭示了真正的运行边界。

基于大小的过滤没有定义有效管理流量

该通道的过滤器拒绝 64 字节或更小的数据包。该规则符合对正常消息和无效分片的预期,但它并未验证较大的数据包是否属于管理路径。异常数据包长于阈值,具有看似有效的头部和校验和,并被接受。由于它们也没有过期时间并使用广播目标地址,接受本身足以启动持续重传。[1]

校验和回答一个狭隘问题:数据位是否与校验和计算一致。它不能证明消息经过授权、有意义、安全或针对特定节点。同样,大小阈值可以拒绝一类异常流量,却无法定义完整的允许命令集。这次断网展示了筛选已知错误与只允许预期控制流量之间的区别。

FCC 建议设计允许预期流量的兜底过滤。它还描述了 CenturyLink 为更新以太网策略所做的工作,以便无效数据包能够在传播前被识别和终止。[1] 这些措施指向多个防御层次:验证消息结构、将流量绑定到预期对等方和功能、约束广播行为、施加速率限制、强制过期、保护处理器容量,并对异常管理事件发出告警。

没有公开来源能确定可以防止该故障所有变体的精确过滤器。专有协议和完整实现并未公开。在系统外部规定数据包规则并声称它能解决问题是不负责任的。证据确实支持这样一个设计目标:意外数据包不应在网络管理平面内拥有不受限制的到达范围、生存时间和处理优先级。

故障遏制还应当预料分类不完善的情况。一个数据包可能看起来足够有效以通过语法检查,但在运营上仍然危险。即使验证未能发现异常,速率限制和资源分区也能减少伤害。跳数或时间限制可以阻止永久循环。按对等方控制可以防止单个节点在整个拓扑中放大流量。当处理器使用率或重传超过某个有界阈值时,断路器可以禁用可选管理路径。

这些控制存在可用性权衡。过于严格的过滤器可能丢弃合法的重路由指令。速率限制可能在实际故障期间延迟恢复。自动关闭可能在最需要时移除某项能力。因此,问责需要有经过测试的推理,而不是“越严格越安全”的口号。运营商和供应商应展示预期流量模型、故障测试、阈值理由、回滚路径,以及证明保护措施保留必要操作的证据。

12 月的事件为这种验证提供了实际测试案例。一个有界演练可以将异常或意外管理流量注入代表性环境,观察它是否会过期、保持隔离、触发告警、保持节点同步,并保留诊断访问。公开纠正记录称监测和策略已改进。它没有发布对这些控制的完整独立测试,因此长期持久性仍是一个待解决的证据问题。

诊断通过同一拥塞系统失败

CenturyLink 在 12 月 27 日凌晨 3:56 收到新奥尔良附近客户询问后,首次确认发生重大事件。告警显示 Infinera 控制模块出现问题,公司确定断网范围广泛。然而,管理员无法远程连接到受影响节点,因为这些节点已经过载。用于检查和控制系统的那条系统,在其需要诊断的故障期间变得不可用。[1]

这是反复出现的基础设施风险。集中式管理在正常运营期间提高效率,但它可能在服务和修复之间形成共享依赖。如果生产网络承载所有管理访问,转发或控制故障可能使响应者被隔离。如果同一处理器在处理客户流量、管理流量和诊断功能时保护不足,资源耗尽可能在最需要可观测性的时刻将其移除。

CenturyLink 使用基于物理在场的备份路径。新奥尔良的管理员联系了圣安东尼奥和 Infinera 的团队。工程师被派往奥马哈和堪萨斯城直接登录。堪萨斯城的一次数据包捕获包含一个指向丹佛节点的地址。现场访问帮助识别并移除了生成模块。[1] 该后备方案奏效,但在全国性网络中,差旅和手工处理耗费了时间。

FCC 建议为正常监测不可用的情况制定标准操作规程。它还建议定期审计和校准的内存与处理器告警。报告指出,迅速下降的处理容量并未触发能够提供所需早期预警的告警。[1] 一个只在节点变得不可达后才报告的监测系统,可能在技术上存在,但在运营上已经迟到。

次级可观测性应当围绕独立性设计。它可以包括带外管理网络、受保护的本地控制台接入、本地遥测缓冲、独立采集器、现场访问计划,以及中央仪表盘失效时的操作程序。合适的架构取决于规模和风险。关键是备份路径不能静静地共享与主路径相同的拥塞、路由、电力、认证或控制依赖。

测试是必要的,因为带外标签不能证明独立性。控制台服务器可能使用与生产路径相同的运营商、楼宇入口、身份提供商、DNS 解析器或电力系统。现场工程师可能缺少当前凭证或物理访问。本地记录可能已经过时。可信演练应当证明响应者能够在普通管理不可用时到达代表性节点、获取有用状态、发出有界命令、跨区域协调,并保持审计轨迹。

事件还提出了组织问题。当远程可见性消失时,谁有权从中央诊断转向物理干预、禁用网络功能或隔离设备?技术可行的后备方案可能因决策延迟而失败。公开时间线显示升级、供应商参与、派员、数据包捕获、模块移除、通道禁用和重新对齐。但它并未披露每一次内部批准或交接。这些记录对完整审查很重要。

移除源头并未移除分布式状态

工程师在 12 月 27 日晚上 9:02 识别并移除了生成数据包的丹佛模块。断网并未立即结束。已在网络中循环的异常数据包继续复制和移动。触发点已被移除,但系统仍处于有害状态。[1]

这种区分是恢复工程的核心。一个组件可以启动一种在组件消失后仍然存在的分布式状况。队列保留工作。对等方重传消息。节点保持不同步。控制状态出现分歧。只依赖更换表面源头的恢复计划可能因此无法恢复服务。

12 月 28 日午夜过后,一名工程师开始指示节点不要确认异常数据包。团队禁用了专有管理通道,停止了通过该路径的进一步传输。CenturyLink 和 Infinera 重新对齐成对线路模块,使它们通过相同的交换模块通信并恢复同步。到清晨,网络大部分恢复正常。远程可见性在当天上午晚些时候恢复。所有节点在 12 月 28 日晚些时候恢复,一些残余影响一直持续到 12 月 29 日骨干网络被认为稳定为止。[1]

时间线包含若干恢复门槛。源模块被移除。数据包复制被抑制。通道被禁用。线路模块被重新对齐。网络的大部分功能恢复。远程访问恢复。所有节点恢复。残余客户影响被清除。骨干网络被认为稳定。这些里程碑中的任何一项都不应取代其他所有里程碑。

一份可问责的事件记录应当保留这些层次。它应识别命令或物理操作、目标组件、观察到的结果、剩余症状,以及用于推进事件状态的证据。单一“已解决”时间戳可能掩盖服务、管理可见性、冗余或稳定性是否真正恢复。

恢复控制还需要考虑修复本身带来的风险。在降级网络中禁用管理功能或重新对齐模块,可能移除容量或引入额外状态变化。团队需要有界程序、分阶段验证、回滚标准和清晰的命令权限。公开报告描述了成功的大范围行动,但没有披露详细的执行顺序或测试结果。

教训不是分布式网络无法恢复,而是恢复计划应当对持久状态建模,并定义如何排空、过期、失效或隔离它。对管理流量而言,这包括明确的生存时间控制、序列处理、按节点隔离,以及一种经过测试且不依赖失效通道的停止传播方法。对服务恢复而言,这意味着验证端到端行为,而不是假设更换源头已经修复了每一条依赖路径。

全国性影响需要规范的数字

FCC 描述了一次全国性语音、IP 和传输中断。CenturyLink 估计超过 1200 万次呼叫被阻断或质量下降。报告指出政府服务影响和巨大的传输容量影响。下游提供商分别提供了用户、呼叫、电路和断网时长估计。[1] 这些数字显示了严重性,但如果不理解每项指标测量的内容,就无法相加或比较。

“潜在受影响”比经确认的故障范围更广。用户可能属于暴露于断网的服务区域或网段,却未尝试呼叫。“被阻断或质量下降”将呼叫未完成与质量受损合并。呼叫估计可能包括重试。电路冗余丢失可能让主路径继续工作。容量指标描述的是传输设施规模,而不是实际客户需求。自动位置信息故障可能在语音接通的情况下损害应急响应。

因此,本文避免使用单一的全员受害者人数。FCC 逐提供商表格和叙述在作为独立的运营观察保留时更有用。TeleCommunication Systems 报告失去 CenturyLink 电路,导致冗余消失,并影响华盛顿州、得克萨斯州中北部和小型无线提供商。West Safety Services 描述了影响得克萨斯州和蒙大拿州选择性路由器的一个受影响传输要素。Verizon 报告了西部几个州的移动和 911 相关影响。Comcast 描述了中继、备份路径、通话质量问题,以及爱达荷州和加利福尼亚州之间的差异。[1]

这些记录还表明,同一传输事件产生了不同的故障模式。一些呼叫者听到快速忙音。一些呼叫被阻断或质量下降。一些公共安全应答点缺少自动号码或位置信息。一些提供商保留了可用路径。一些政府机构失去普通电话服务。这种差异是有关依赖和架构的证据,而不是应被清除的噪音。

同期报道记录了受影响地区公开指示使用替代十位号码或其他渠道的通知。[13][14][15][16][17][18] 这些通知作为沟通证据很重要,但它们发布时技术和地理图景仍在发展。一个司法辖区的警告不能证明全国性故障率。后来的恢复公告也不能证明每个残余问题都在同一时刻结束。

公开报道还应当区分网络影响与法律因果关系。华盛顿州总检察长页面包含无法拨通 911 的人的证词,并描述了严重后果。[7] 这些陈述展示了人的利害关系以及可靠应急传输的重要性。它们不允许外部文章为每个结果确定医学因果关系。证词本身在某些地方保留了不确定性,本文也应如此。

规范的数字改进问责,因为它们使控制测试成为可能。运营商应当能够按服务和地理位置报告尝试呼叫、完成呼叫、受阻呼叫、质量下降呼叫、重试呼叫、受影响的干线、丢失的冗余、缺失的位置数据以及恢复情况。监管机构随后可以将事件期间的主张与保留的网络证据进行比较。一个大的未区分估计无法回答这些问题。

应急服务冗余在依赖仍然共享的地方失效

应急通信依赖的不只是 911 号码。一次呼叫穿过始发网络、传输设施、路由系统、服务提供商、选择性路由器、公共安全应答点,以及传递呼叫者号码和位置的系统。不同组织控制不同链路。因此,即使受影响传输的运营商不是呼叫者的零售运营商或应答点的直接运营者,长途传输故障也可能损害应急服务。

FCC 报告称,CenturyLink 本身未能送达转发到其服务的二级 PSAP 的 11 次呼叫,也未能向西部几个州的 15 个 PSAP 送达自动位置信息。其他提供商因依赖 CenturyLink 传输而遭受更广泛影响。TeleCommunication Systems 报告在总计 49 小时 32 分钟内失去电路冗余。West Safety Services 报告在得克萨斯州和蒙大拿州发生 75 次失败的 911 呼叫。Verizon 和 Comcast 描述了更多呼叫和位置信息影响。[1]

Comcast 的例子对理解实际多样性特别有用。在爱达荷州,CenturyLink 为通往选择性路由器的主用和备用路径提供传输。一条使用十位号码的第三方三级路由仍然可用。在加利福尼亚州受影响地区,CenturyLink 提供主用路径,而第三方提供二级和三级路由;呼叫成功使用了冗余的二级路由。[1] 主用、备用和三级等标签并不决定韧性。提供商和故障域的独立性才决定。

因此,电路多样性应当端到端记录。两条电路可能具有不同的订单号、接口或本地接入,却共享同一运营商骨干、光纤管道、光平台、楼宇、电源或管理系统。止步于供应商名称的采购记录可能遗漏共同的物理或运营基础设施。反过来,来自同一企业集团的两项服务有时可以使用真正分离的网络。证明必须来自有界的路由和依赖证据。

应急服务购买者可能无法直接检查每个运营商细节。合同可以要求多样性声明、重大路由变更通知、关键电路的受保护标识、定期审计和独立验证。敏感地图不必公开,但购买机构应当知道其备份路径能否在其声称覆盖的故障场景中存活。

测试必须包括呼叫完成和位置送达。语音路径可能接通而自动位置失败。十位号码替代方案可以绕过一项路由依赖,却缺少 911 应有的位置和优先级行为。公开通知可以引导呼叫者使用备用号码,但这种变通方案需要最新的联系数据、足够的人员、可访问的沟通渠道以及负载测试。不应将其描述为等同于完整的应急呼叫服务。

运营证据比标签更重要。路由登记、清单或合同作为记录有用,但决定性证据是运行中的基础设施实际做了什么。独立路径是否承载呼叫?呼叫者位置是否到达?监测是否显示完成?响应者能否快速识别故障?运营连续性由这些结果证明,而不是仅凭许可语言或一张图。

华盛顿州迁移暴露了另一层集中

华盛顿州后来的裁判记录涉及特定 911 迁移,叠加在全国性传输故障之上。在 Comtech 承担全州系统责任的同时,CenturyLink 和 Comtech 均参与其中。断网发生时,47 个 PSAP 已迁移到 Comtech 的 ESInet II 网络,15 个仍留在 CenturyLink 的 ESInet I 上。华盛顿州上诉法院描述,为已迁移 PSAP 服务的全部四条 Comtech SS7 电路都依赖 CenturyLink 的 Green Network。[3][4][8][9]

当 Green Network 遭遇数据包风暴时,根据后来的法院陈述,拨打已迁移 PSAP 的超过 13,000 次呼叫失败。CenturyLink 为剩余 15 个 PSAP 提供服务的自有 SS7 电路使用了多样化网络,基本未受影响。[8][9] 这种对比使迁移设计成为华盛顿州程序的核心。

记录还包含有争议的责任论点。公共辩护办公室声称 CenturyLink 设计了连接、使用了不够多样化的技术,并未能履行通知义务。[7] CenturyLink 对委员会分析的某些方面提出异议,并寻求复议和司法审查。州案卷包括工作人员报告、投诉、证词、命令、申诉和答复。[3][4] 文章不应将这一程序顺序压扁为一项无差别的认定。

华盛顿州公用事业与运输委员会 2020 年的发布描述工作人员指控和拟议最高 720 万美元罚款。页面明确表示这反映工作人员立场,而非委员会最终观点。[5] 2023 年,委员会宣布最终罚款 131.5 万美元,并认定至少 13,000 次呼叫失败、技术错误、网络设计和迁移义务等问题。[6] 不应将较早的拟议数字报道为最终执行金额。

上诉意见提供了后来对断网和委员会认定的法律陈述。[8][9] 它是华盛顿州记录的适当权威,但不能取代 FCC 的全国性技术报告。两项调查回答相互重叠但不同的问题。FCC 审查长途事件、其全国影响和可靠性实践。华盛顿州审查州内 911 义务和迁移拓扑。

这种区分也强化了问责教训。全国性数据包风暴源自运营商传输网络。华盛顿州严重的呼叫失败取决于迁移电路如何使用该网络。触发点和放大路径可以由不同决策控制。将所有责任归于模块会忽略路由集中。将全国性设备故障归于迁移同样是错误的。

迁移期值得显式的依赖审查,因为临时架构可能比假设存续更久。新旧提供商可能在责任转移时共享设施。工作人员可能认为服务因所有者或合同名称不同而具有多样性。监测和升级可能被分割。迁移闸门应当在关键流量移动之前验证实际路由、提供商、设施、管理和通知的独立性。

责任跟随控制,而不是离故障卡最近的人

离故障模块最近的工程师并未设计每一个功能默认值、过滤器、传输依赖、告警、合同或监管规则。有用的问责模型应当绘制事件之前、期间和之后存在的控制。

CenturyLink 控制受影响网络的生产配置、功能状态决策、监测、维护程序、管理访问、现场派工、事件指挥、客户通知以及向许多下游服务提供的传输。它还掌握映射受影响节点和电路如何相互依赖所需的信息。这些控制使隔离、可观测性、修复准备和披露方面的问题具有正当性。它们本身并不能证明故意行为,也不能证明每个设计选择在作出时都不合理。

Infinera 控制产品行为、固件、默认启用的管理功能、文档、供应商诊断以及部分纠正设计。FCC 报告称,供应商无法重现异常数据包如何生成。断网之后,Infinera 在 CenturyLink 的新节点上禁用了该通道并更新了文档。[1] 因此,供应商责任应通过缺陷处理、默认安全性、协议边界、更新支持以及与运营商共享的证据来审查。

下游运营商和 911 服务提供商控制路由采购、替代运营商选择、呼叫路由、PSAP 通知、监测和客户沟通的不同部分。它们的控制受到 CenturyLink 提供的信息以及对底层路由合同可见性的约束。提供商无法禁用另一家运营商网络内部的专有功能。它可以询问主用和备份路径是否共享该网络,并在共享时建立响应机制。

公共机构控制可靠性要求、事件报告、调查、采购标准和证据要求。FCC 和华盛顿州程序产生了持久的技术和法律记录。监管机构无法保证任何组件都不会故障,但可以要求准确通知、保留事件证据、验证电路多样性,以及证明纠正控制已实施。

公共安全应答点控制本地备用号码、人员配置、公开通知和一些测试。它们的选择是在紧急状况下作出的,并依赖提供商提供的信息。记录应审查它们是否收到及时、可操作的通知,而不暗示 PSAP 造成了传输故障。

责任在这些参与者之间分配,并不等同于同等责任。每一方都应根据其实际控制的系统和决策接受评估。这种方法可以防止两个相反的错误:将系统性事件简化为一张缺陷卡,以及在未审查其他地方作出路由和迁移选择的情况下,将每一个下游后果都归于骨干运营商。

纠正行动应作为运行控制来评估

CenturyLink 和 Infinera 采取了若干有记录的行动。它们在受影响网络中禁用了专有管理通道。Infinera 在 CenturyLink 的新节点上禁用了该通道并修改了手册。两家组织为网络管理事件制定了监测计划。CenturyLink 改进以太网策略以阻止无效数据包,加强处理器和内存使用的监测与审计,并审查客户通知。[1]

FCC 将事件转化为更广泛的可靠性实践。未使用的功能应禁用。过滤器应允许预期流量,而不是只拒绝一个狭窄的已知坏模式。处理器和内存告警应审计和校准。修复程序应涵盖正常监测丢失的情况。[1] 2020 年同意令在解决联邦调查的同时增加了合规义务和民事罚款。[2]

这些行动很重要,但行动清单不能证明持久修复。更强的问题是控制措施是否保持部署、覆盖目标节点群体、在升级后幸存、产生有用告警并通过演练。本文审查的公开证据并未提供多年后完整的独立复测。

运营商可以通过签名的功能清单、配置合规结果、管理流量测试、告警演练、带外接入演习、事件模拟和例外记录来证明持久性。供应商可以展示已修复的固件行为、发布说明、默认状态变更、回归测试和客户通知。监管机构可以审查受限证据并发布适当限定的合规结论。

证据应当与当前系统状态绑定。2019 年的修复报告不能证明后来部署的替代平台继承了同等的控制。公司名称、平台、架构和设备可能在事件后改变,因此当前控制证据应绑定到特定网络、配置和测试群体,而不是从遗留修复中推断。本文中的事件和结论仍与 2018 年的 CenturyLink 系统和所引记录相关。

这是运行代码优先原则的又一应用。政策和手册是有用的记录。决定性问题在于实际设备是否拒绝意外管理流量、保留资源余量、发出告警,并在压力下保持可管理性。受控测试提供比“建议已被接受”声明更强的证据。

同样的道理适用于电路多样性。合同可能要求多样化服务,但路由变更可能静默地重新汇聚路径。定期审计应将已记录的多样性与当前的运营商、设施和管理依赖进行比较。关键电路应添加标记,使日常配置不会破坏其分离性。连续性是一种需要维护的属性,而不是一次性采购事件。

管理面连续性最低证据包

12 月断网为证据包提供了实际基础,董事会、运营商、供应商、服务购买者和监管机构可以在不要求不可能的公开披露的情况下索要这些证据。

控制面应存在的证据证据能够证明什么仅凭证据不能证明什么
功能清单当前节点清单、启用/配置/使用状态、命名责任人、例外批准和验证日期未使用的管理功能是否已知并受到治理不存在未知固件路径或缺陷
管理流量策略预期消息类型、对等方范围、验证规则、过期、速率限制和资源边界意外控制流量是否具有受限的到达范围和生存时间每个新型异常数据包都会被正确分类
可观测性处理器和内存告警、校准测试、管理事件遥测、次级采集器和留存过载能否在节点不可达之前被检测到响应者能正确解读并处理告警
管理访问带外拓扑、控制台清单、凭证测试、现场访问计划和演练结果当生产管理失效时,运营商能否到达设备每个地区都能在真实事件中立即到达
恢复状态数据包抑制、功能禁用、节点隔离、同步、重置和服务测试记录分布式有害状态是否按受控顺序清除所有客户在第一个基础设施里程碑即恢复
关键电路多样性运营商、设施、路径、管理域、电力和路由变更记录主用和备用服务是否避免已知共同依赖不存在未披露或新引入的共同风险
应急服务结果尝试/完成/失败呼叫、位置送达、干线状态、备用方案使用和 PSAP 通知按时间和地理位置哪些功能正常工作每一起个人结果的医学或法律因果关系
纠正持久性配置合规、固件测试、演练、例外和独立审查已发布的修复是否继续运行更广泛的网络没有无关的韧性风险

该证据包将记录与主权或倡导分开。登记或清单并不因为记录状态就控制网络。它通过保留唯一性、准确性、变更、安全元数据和运营连续性来支持问责。运营商仍然对运行设备和服务的责任。监管机构和客户可以使用记录来检验主张,而无需假装文档本身就能修复基础设施。

安全限制是正当的。详细的管理拓扑、数据包格式、凭证和关键电路路由不应随意暴露。证据可以在保护程序下审查、聚合、独立证明,或在移除敏感细节后发布。保密性应当缩小披露范围,而不是消除保留和测试底层证据的义务。

证据包也有助于防止事后偏见。审查应询问事件前预期哪些控制、批准了哪些例外,以及每个时点有哪些信号可用。不应假设工程师当时立即知道 FCC 后来重建的机制。恢复时间线显示在失去可见性的情况下进行了一次艰难调查。问责可以承认这种困难,同时仍然追问架构和程序是否使其不必要地严重。

给运营商、服务购买者和监管机构的问题

运营商应从当前状态开始。长途平台启用了哪些管理功能?哪些未使用?谁负责每项例外?允许哪些流量?什么限制其生存时间和传播?哪些处理器资源受到保护?最近一次在代表性环境中测试异常或意外流量是什么时候?

然后应检查可见性丢失。响应者能否在没有生产网络的情况下到达节点?控制台路径是否依赖同一运营商、身份提供商、DNS、电力或设施?团队能否在本地获取数据包捕获和配置状态?现场访问联系人、凭证、备件和供应商升级路径是否最新?现实演练需要多长时间?

恢复规划应区分触发点移除与状态清除。源头隔离后,队列、对等方或同步模块中还剩什么?哪些操作停止复制?能否在降级网络中安全禁用某项功能?什么证据表明线路模块、路由、客户流量和远程可见性已恢复正常?哪个里程碑授权发布公开恢复声明?

关键服务购买者应索取路径证据。主用和备用电路是否使用不同的运营商、设施、光网络、管理域和电力?如果共享依赖,存在什么三级或程序性后备方案?备用的十位号码是否真正独立于故障路由?备用方案是否保留自动位置信息,是否已与应答点测试?

监管机构应询问报告类别是否符合运营现实。提供商能否区分失败呼叫、质量下降呼叫、丢失的冗余、缺失的位置数据和潜在受影响用户?呼叫重试是否保持一致计数?事件通知是否标明不确定性?早期估计变化后,最终报告是否得到纠正?

董事会应避免将事件视为狭隘的设备问题。当长途网络承载公共安全和其他关键服务时,管理面隔离、诊断访问、关键服务依赖和供应商默认值是企业风险。监督应要求测试证明,而不是网络冗余的一般声明。

这些问题都不需要假设存在不当行为。它们是与已知控制相联系的证据请求。答案可以显示风险已被识别并受限、例外具有正当理由,或修复有效。缺失或矛盾的记录本身可以识别治理缺口,而无需解决法律责任。

与 CenturyLink 2020 年 FlowSpec 断网的比较

同一运营商在 2020 年 8 月经历另一次重大网络事件。该事件涉及客户请求的流量过滤操作、FlowSpec 策略、跨 Level 3 骨干的传播、BGP 效应和变更控制保障。它与 2018 年案例相邻,因为两者都涉及具有广泛到达范围的控制机制。但它不是同一事件,也不是同一命题。

2018 年 12 月的故障源自光传输设备。专有管理通道在节点间承载异常数据包,处理器使用率上升,线路模块失去同步,远程管理失效。问责控制包括功能状态、数据包验证和生存时间、资源隔离、次级可观测性、现场访问、电路多样性和 911 连续性。

2020 年 8 月事件涉及流量策略和路由变更。其控制包括请求范围、通配符行为、次级过滤器、通过路由基础设施分发、变更授权、回滚以及防范骨干级策略效应。将 2018 年事件描述为 BGP 或 FlowSpec 在技术上是错误的。将两次事件视为同一命题会抹去它们不同的故障平面和控制面。

这种比较有用,因为它展示了两类管理面风险。一条路径是专有光设备协调;另一条是路由和流量策略机制。两者都表明,当控制边界失效时,一个小的管理输入可以获得广泛的运营到达范围。证据和修复问题仍然各自独立。

这种边界也防止了更广泛的错误:将每一次运营商断网视为一个通用可靠性故事。网络基础设施问责取决于实际层次、协议、权限、传播路径和保留证据。骨干网络可能通过光纤损坏、电力、BGP 策略、DNS、软件状态、光同步、信令过载或供应商控制而失败。文章应指明能够证明的机制,并保留仍未知的内容。

公开记录不能证明什么

FCC 报告未能确定丹佛交换模块究竟如何或为何生成四个异常数据包。因此,本文不将生成归因于特定代码缺陷、运营者命令、恶意行为或维护事件。它描述了 FCC 记录的数据包属性和传播机制。[1]

专有协议、完整数据包捕获、固件源代码、每个节点配置以及完整内部通信均未公开。外部观察者无法重建事件的每一个分支,也无法测试所有供应商和运营商的断言。证据支持关于已发布架构和序列的结论,而不是完整的取证模型。

报告中的影响数字不完整且异构。本文不声称每一位潜在受影响用户都失去服务、每一次被阻断或质量下降的呼叫都是紧急呼叫,也不声称所有服务在同一时间恢复。它不将重叠的提供商估计相加为全国总数。

华盛顿州记录包括认定、指控、证词、申诉和司法审查。本文区分工作人员拟议罚款与委员会最终罚款,并注明公共辩护办公室的立场。它不推断刑事责任。它不对证词描述延迟应急接入的人作出医学因果判断。

纠正记录建立了行动和建议。它不能独立证明每项控制在当今所有 Lumen 平台上仍然有效。本文要求当前证据,却不断言修复失败。

最后,事件不能证明所有共享传输都不可接受,也不能证明零共模风险可实现。网络在容量、成本、地理、运营复杂性和安全之间取得平衡。问责标准在于依赖是否已知、是否被准确陈述、是否在现实故障下测试,以及是否有修复路径支持。这是一个严格的标准,但比从断网规模推断责任更窄,也更站得住。

结论:隔离必须在运行网络中证明

CenturyLink 2018 年 12 月的断网将四个异常数据包变成全国性传输和公共安全事件,因为网络给了这些数据包一种强大组合:广播到达范围、表面上的有效性、没有过期时间、访问已启用的管理通道,以及被连接节点反复处理。反馈循环损害流量并移除正常的远程管理。工程师最终依靠现场访问、数据包捕获、功能禁用、模块重新对齐和分阶段恢复。

事件使管理隔离成为问责考验。运营商应知道哪些控制功能已启用,约束意外流量,保护诊断容量,并在普通管理网络不可用时保留修复路径。供应商应使默认值和故障行为可辩护。关键服务购买者应知道备份电路在重要系统中是否独立。监管机构应要求区分尝试呼叫、完成、位置送达、冗余丢失和恢复的证据。

这些不是声称每一次故障都可以被预测。它们是限制不可预测故障的控制。FCC 自己的纠正建议反映了这种区分:禁用未使用功能、允许预期流量、监测资源耗尽,并为失去正常可见性做好准备。[1]

最强证据是运营性的。功能清单应匹配实际节点状态。过滤器应阻止经过测试的意外流量。带外路径应在生产网络故障时到达设备。多样化电路应在主用传输故障时完成呼叫。恢复记录应显示每一层在何时恢复。文档支持这些测试;它不能替代它们。

这一现实层面是断网的持久教训。网络不会因为图上画出独立方框而被隔离,应急服务也不会因为合同列出两条电路而冗余。隔离和连续性存在于运行系统阻止一次控制故障越过预期边界、以及独立路径保持所需服务正常工作的时候。

来源

  1. 美国联邦通信委员会,《2018 年 12 月 27 日 CenturyLink 网络中断报告》:https://docs.fcc.gov/public/attachments/DOC-359134A1.pdf
  2. 美国联邦通信委员会执法局,CenturyLink 同意令,DA 20-1469:https://docs.fcc.gov/public/attachments/DA-20-1469A1.pdf
  3. 华盛顿州公用事业与运输委员会,案卷 UT-181051 文件集:https://www.utc.wa.gov/casedocket/2018/181051/docsets
  4. 华盛顿州公用事业与运输委员会,案卷 UT-181051 命令:https://www.utc.wa.gov/casedocket/2018/181051/orders
  5. 华盛顿州公用事业与运输委员会工作人员,拟议罚款发布:https://www.utc.wa.gov/news/2020/centurylink-faces-72-million-penalty-2018-911-outage
  6. 华盛顿州公用事业与运输委员会,最终罚款发布:https://www.utc.wa.gov/news/2023/state-regulators-fine-centurylink-more-13-million-911-outage
  7. 华盛顿州总检察长,公共辩护办公室证词摘要:https://www.atg.wa.gov/news/news-releases/ag-ferguson-centurylink-responsible-widespread-911-outage
  8. 华盛顿州上诉法院,意见 86763-6-I:https://www.courts.wa.gov/opinions/pdf/867636.pdf
  9. Justia 公开镜像,CenturyLink Communications 诉华盛顿州公用事业与运输委员会:https://law.justia.com/cases/washington/court-of-appeals-division-i/2025/86763-6.html
  10. Ars Technica,对 FCC 报告的技术分析:https://arstechnica.com/information-technology/2019/08/centurylinks-37-hour-outage-blocked-911-service-for-17-million-people/
  11. SDxCentral,FCC 报告与 CenturyLink 回应:https://www.sdxcentral.com/news/fcc-issues-scathing-report-on-37-hour-centurylink-outage/
  12. Light Reading,CenturyLink 事件记录:https://www.lightreading.com/digital-transformation/why-centurylink-s-network-suffered-a-christmas-hangover
  13. GeekWire,同期管理卡报告:https://www.geekwire.com/2018/report-huge-centurylink-outage-caused-bad-networking-card-colorado/
  14. 华盛顿邮报,同期断网与调查报道:https://www.washingtonpost.com/technology/2018/12/28/nationwide-centurylink-outage-is-disrupting-fcc-is-investigating/
  15. CBS News 与美联社,同期 911 中断报道:https://www.cbsnews.com/news/centurylink-outage-knocks-out-911-call-services-fcc-investigation/
  16. TechCrunch,同期 911 断网与恢复报道:https://techcrunch.com/2018/12/28/911-service-outage-centurylink/
  17. Route Fifty,各州对 911 与服务断网的响应:https://www.route-fifty.com/management/2019/01/states-respond-911-outage/153892/
  18. The Spokesman-Review,区域应急服务影响报道:https://www.spokesman.com/stories/2018/dec/28/spokane-unaffected-by-widespread-9-1-1-outages/
  19. Tom's Hardware,同期技术报道:https://www.tomshardware.com/news/centurylink-outage-caused-bad-networking-card,38306.html
  20. The Register,同期断网后续报道:https://www.theregister.com/2019/01/02/centurylink_911_outage_aftermath/