摘要
- KDDI 表示,通信故障于 2022 年 7 月 2 日凌晨 1:35(日本标准时间)开始,且其称服务使用量于 7 月 4 日 15:00 恢复到前一周同期水平。官方披露的影响时长为 61 小时 25 分钟,覆盖日本全国。[1][5][7]
- 触发性中断时间要短得多。KDDI 在 Tama 网络中心对全国传输网路由器进行维护时,错误的路由设置导致约十五分钟的流量中断。恢复该设置后中断并未结束。[1][5]
- 设备和设备间反复重发位置注册请求。VoLTE 节点出现拥塞,通过全国传输网络的分布式处理将压力扩散到其他站点上的 VoLTE 节点。[1][5][9]
- KDDI 估计,非合并口径下约有 2,278 万语音用户和至少 765 万数据用户受影响。若包含 Okinawa Cellular,约为 2,316 万语音用户和至少 775 万数据用户。这些是服务影响估计值,不代表独立的唯一人数。[1][5][14]
- 2022 年 11 月对行政指导的回应称,采用了错误的作业指引文档,审批与回退控制需要修订,自动拥塞控制不足,受损的备份状态影响了部分重启,且订阅会话不一致使恢复复杂化。[8][9]
- 正式国会记录显示,KDDI 发起的 119 呼叫量约比正常水平低 63%,110 呼叫量约低 45%;同时其他路径承载了更多通话。[20]这说明的是观察到的通话量变化,不代表每一通紧急呼叫均未接通。
- KDDI 公布了基于条款的赔付和道歉退款,并估计财务影响约 75 亿日元。退款对象、服务影响估计、订阅量与唯一人数必须保持独立衡量。[1][11]
- 问责并不止于“谁设置了错误参数”。它还包括对流程交接、专家复核、审批证据、回退时机、异常状态测试、拥塞可观测性、备份完整性、订阅者状态恢复以及服务级别恢复证明的实际控制。
- KDDI 发布了大量整改措施,包括更严格的流程控制、拥塞治理工具、启用流量控制、拓扑调整、恢复自动化、质量治理和沟通改进。这些公开举措是承诺或实施的主张,而非对所有相关故障类型已被消除的独立证明。[9][10][15][17]
- 日本后续推出的紧急漫游服务在重大故障时可形成替代路径。它应被视为有边界的韧性控制,而非替代修复运营商自有网络脆弱性,或作为唯一由本次事件导致的政策结果。[22]
首个问责事实是时间不一致
KDDI 的公开时间线里出现了两把不同的“时钟”。
第一把时钟对应于初始路由中断。维护全国传输网络中的一台路由器时,错误路由设置使经过该路由的部分流量中止。KDDI 将该中断持续时间描述为约十五分钟。配置随后被回退。[1][5]
第二把时钟对应于对客户和服务的影响。KDDI 表示,通信故障于 2022 年 7 月 2 日星期六凌晨 1:35 开始;其称语音与数据使用量在 7 月 4 日星期一 15:00 恢复到与一周前同一时段可比的水平。该时长为 61 小时 25 分钟。后续于 7 月 5 日报告了更高层次的客户使用和流量正常性复核。[1][7]
把它说成“61 小时路由错误”并不成立。把它说成“十五分钟中断”也同样不成立。
路由错误是触发因素。长期故障是围绕信令负载、VoLTE 节点、订阅者身份认证、状态不一致、受损备份状态以及对哪些组件隔离、何时隔离的运维决策形成的恢复问题。区分二者很关键,因为对触发因素的责任与对放大效应的责任并不必然重合。
一次错误操作并不必然扩大失控;若错误被及时封闭、回退假设真实可行且下游系统能吸收临时异常,问题可以被快速遏制。它也可能是一个短命错动作却在其他位置制造持久状态:设备重试,队列增长,数据库反复被查询,复制状态分歧,恢复动作继续加重负载,组件在异常状态下重启,而每个告警同时触发又使可观测性下降。
因此可问的并非只是“谁输入了错误设置?”。
真正的问题是:
- 谁批准了该变更?依据什么证据?
- 何种影响模型定义了回退上限?
- 哪类下游行为已被验证测试?
- 哪些遥测显示回退并未恢复服务?
- 谁有权在何时隔离节点并抑制负载?
- 可用于恢复的“已知健康状态”是什么?
- 哪些服务测试定义了恢复成功?
一种以“归责个人”为先的调查,很容易把链条简化到最靠近命令行的人。以“控制优先”为导向的调查会检查设计该变更的人与制度、批准风险的机制、塑造网络异常行为的控制体系,以及何时可对外说明服务恢复。
KDDI 的监管应对报告指向同一方向。它提到流程文档管理、专家复核、审批证据、回退条件、拥塞设计、恢复流程和质量治理。[9] 运营商自述因此支持更宽的结论:一次网络变更不是一个人的按键动作,而是组织控制的一部分。
路由变更如何演化为信令连锁反应
移动通信服务依赖大量终端用户无法直接感知的信令。
一部手机必须先向网络附着并确认可达区域。使用 VoLTE 的语音服务要求网络知道订阅者的注册位置以及哪些控制功能可建立呼入或呼出通话。数据服务同样依赖订阅者鉴权与会话状态。以上操作需要终端、移动网功能、VoLTE 节点与订阅者数据库之间反复交换消息。
在正常情况下,这部分信令仅占用户体验“可见价值”的一小部分。用户看到的是通话、消息或数据会话,前置则是若干成功的注册、鉴权、策略和路由交互。
KDDI 的技术说明称,错误的路由设置使位置注册请求被放弃。设备与设备间装置随后重复发送请求,重传快速上升。Tama 的 VoLTE 节点出现拥塞,且全国传输网络中的分布式处理将压力扩展到其他站点上的 VoLTE 节点。[1][5]
随后,订阅者数据库成为放大链条的一环。KDDI 解释,VoLTE 节点和移动网设备会向该数据库发起鉴权查询,因此重传信令转化为反复的数据库流量。系统当时不仅是“有太多用户来电”,而是因为“注册不完整与重试行为”持续制造了过量控制请求。
这一点对工程和问责都十分关键。
传统容量规划会问单个节点能承载多少并发通话、数据会话或订阅者。异常状态规划问的是:当消息在事务途中部分失败并被数百万设备重试时系统将如何演化。后者常形成与高峰业务需求不同的负载形态。
重传机制通常是可靠性设计。它可以避免用户受单个丢包或短时中断影响。然而在国家级规模下,同步或边界不足的重传会变成负载倍增器。一次请求失败,终端重试,网络功能重试,数据库再次处理鉴权请求,慢响应导致更多事务长期挂起,增长的队列又会引发更多超时与重传。
故障因此跨越了多道控制面:
- 路由控制:是否将流量导向预期路径。
- 重试控制:当预期响应未到达时,设备与系统如何响应。
- 准入控制:过载节点是否能安全拒绝、延迟或整形新业务。
- 数据库防护:鉴权与订阅状态系统是否能限制重复请求。
- 分发控制:流量分摊是否收敛故障,还是继续扩散。
- 恢复控制:响应方能否识别并隔离过量信令来源。
KDDI 称已启用流速控制以降低数据库拥塞,但过量信令仍持续。其后分离了 18 个 VoLTE 节点中的 6 个,作为持续异常请求来源。[1][5]
这一动作说明了恢复中的权衡:削减容量可降低由局部节点产生的有害负载,但也可能减少正常服务能力。该决策需要可靠遥测与权限边界。恢复方必须判断节点是下游拥塞的受害者、重复请求的源头,还是两者皆是。
公开记录并未披露每一条分组路径、计时器或阈值,但确立了一个事实:系统的异常状态行为是决定性因素。该事件属于网络基础设施层面的问责范畴,因为损害发生在传输路由、信令控制、语音能力与订阅状态之间的交互。
仅恢复路由并不等于恢复
回退常被视为失败变更的安全答案。KDDI 事件说明这一假设有边界。
恢复一项配置可以让状态回到变更前的条件,但无法自动清除该变更活跃期间产生的系统状态。
中断期间,设备与系统都出现了不完整的注册并产生重试;队列与数据库负载发生变化,一些节点进入拥塞。订阅会话信息出现不一致。KDDI 后续回应称,部分 VoLTE 节点读取了受损备份文件并在异常状态下重启,进一步触发位置注册重试。[9]
因此,回退后的网络并非变更前的网络。
这是有状态基础设施的一般属性。无状态的路由项可快速恢复,但依赖该路由的服务仍会保留:
- 尚未完成的事务;
- 重传计时;
- 过期会话;
- 不一致副本;
- 部分鉴权状态;
- 受损队列;
- 缓存失败状态;
- 恢复动作尚在执行中的过程;
变更方案应区分“配置回退”和“服务回退”。
配置回退测试回答的是“是否恢复了原始字节或命令”。服务回退测试回答的是“用户是否能够重新注册、鉴权、通话与建立数据会话且无异常负载”。状态回退测试回答的是“数据库、队列、缓存和节点备份是否一致到足以支撑该服务”。
这些测试在同一时刻可能出现不同结果。
KDDI 发布的措施之一是修订回退前等待时间,纳入下游服务拥塞因素。[9] 这是有意义的控制性变化,意味着等待过久会使一个本来可逆的网络状态演化为有状态危机。
但更早的回退阈值本身不足以解决问题。
运营方还需建立在允许时窗内可累积状态的模型:可生成多少注册重试?哪个数据库首先达到饱和?可在多大范围内隔离?在隔离期内可保留哪些服务?当路由已恢复但数百万设备同时重试时会发生什么?
恢复方案应以服务健康为触发条件,而不仅以路由状态为依据:
- 注册成功率突降;
- 未完成请求增长;
- VoLTE 节点队列深度;
- 订阅者数据库响应时间;
- 鉴权拒绝率;
- 按地区或节点统计的重试量;
- 呼叫建立与完成率;
- 数据会话建立率;
- 应急呼叫成功率。
回退依然是必要手段。关键在于其作用范围必须匹配系统边界。
对一个有状态的国家级移动网络而言,“旧路由回来了”只是中间技术状态,而不是完整恢复证明。
程序文档是生产控制平面的一部分
KDDI 的 11 月报告称作业中使用了错误流程文档,并说明已修订流程文档管理、专家复核和作业审批机制。[9]
这听起来像行政事项,实则具有明确运营含义。
维护期输入的命令通过一条链条形成:
- 预期网络结果;
- 设计或变更需求;
- 流程模板;
- 设备级执行指令;
- 同侪或专家复核;
- 审批;
- 排期;
- 执行;
- 验证;
- 回退。
如果一旦选错流程,生产系统在任何人登录路由器前就已处于暴露状态。流程归档能力因此是控制平面的一部分。
一个可靠流程体系应回答:
- 哪个模板是权威版本?
- 它基于哪个网络模型和软件版本?
- 最终指令由谁编制和复核?
- 与上一个批准版本相比有何变更?
- 该流程面向哪类设备或拓扑?
- 哪些证据表明演练或实验结果与生产一致?
- 适用何种风险等级与审批级别?
- 下一步必须通过哪些检查?
- 流程如何停止或回退?
关键词是“证据”。
第二位评审者若只看到最终文档,而看不到预期状态、拓扑、差异和预期输出,复核只剩形式。审批者若只勾选一个框,而未看到失败后果,那么审批也会形式化。
KDDI 表示它修改了流程:由具备资深经验的人员复核流程并留存证据,且让审批者可确认该证据。同时也展开了流程管理系统建设。[9]
这些措施应通过其阻止能力来评估,而非只看是否“有文档”。
管理系统应使以下情况变得困难:
- 对错误设备类别使用流程;
- 执行过时版本;
- 跳过必须的专家复核;
- 批准未充分测试的命令序列;
- 审批后改动指令而不使审批失效;
- 预期输出不一致却继续执行;
- 丢失已执行动作的记录。
高影响网络变更还需要可落地的自动化层。计划中的路由变更应与拓扑和策略可比对;配置差异可进行静态校验;实验室或数字孪生测试应覆盖期望与异常路径;变更前后探针应能自动化执行;限制条件应阻止命令触达超出授权的节点或前缀。
自动化并不取消人为问责。它只是改变了人类可获得的证据。
最终,运营方仍需决定自动化控制要证明什么、如何授权例外,以及当观测状态与计划偏离时如何处理。仅能校验语法的系统,也可能批准语义危险的路由。
KDDI 事件将流程治理显化为基础设施治理。该文档不是网络旁的文书,而是生产权限的可执行说明。
风险分级应按影响半径,而非维护熟悉度
常规作业也可能承载非凡风险。
任务可能对团队来说很熟悉、使用常见命令并安排在维护窗口内,但这些事实都不能决定潜在客户影响。
KDDI 表示其已根据失败后果规模修订作业风险评估与审批层级,也扩大了在关键事件周边抑制某些作业的时段。[9]
这是从“概率优先”转向“后果优先”的重要变化。
对全国传输路由器的风险分级应考虑:
- 经过该路由的服务数量与类型;
- 失败是否会影响注册或鉴权;
- 重试如何传播;
- 负载共享是否会扩散故障;
- 冗余路径的独立性;
- 对紧急呼叫的依赖;
- 对 MVNO 与企业的依赖;
- 是否可观察并隔离该变更;
- 状态何时变得难以恢复;
- 回退和替代系统的实际承载能力。
低估概率并不意味着低责任:即使失败概率低,若后果是全国性共模冲击,仍需最高级别审批和测试。
风险评估还应纳入时间维度。选择低普通流量时段的维护窗口,不等于信令风险低。许多设备可在同一故障下同步响应,即使用户未主动通话。平时低流量时段未必意味着注册风暴低。
同样,事件抑制日历只是一个控制。重大公共事件、恶劣天气或选举可提高故障后果,但普通夜间仍有紧急呼叫、物流、互联设备、运输系统与关键服务作业。
更有力的控制是显式的影响半径预算。
作业开始前,运营方应明确:
- 最多影响多少节点;
- 最多影响多大地理范围;
- 允许的服务中断上限;
- 可接受的注册失败上限;
- 回退最长等待时间;
- 下游恢复最大时延;
- 需要立即隔离的触发条件;
- 作业期间可用的替代能力。
实际观测指标应实时对照该预算。若超过任一限制,继续执行必须通过新的授权,而不能默认原有审批仍然有效。
此种方法把“例行维护”转成边界可控的实验:公众关注的是网络能否持续工作,而不是运维人员是否“熟练”。
拥塞控制必须在故障状态下验证
KDDI 的报告称,异常条件下的自动拥塞控制未按预期工作。其后启用了或修订了流量控制功能,开发了更细颗粒度的检测工具,并调整了相关 VoLTE 流量与承载设计。[9][10]
拥塞控制不能只在普通高负载下评估。
常规高峰包含大量合法请求,具有预期的时序与分布;故障可生成重复、未完成或相关联请求。一个事务可能部分走到一条路径后回复丢失,导致负载集中到平时均衡分流的组件,多个网络功能可能对同一订阅者数据库反复重试。
因此测试应覆盖故障语义:
- 部分路由缺失;
- 非对称可达;
- 响应延迟;
- 重复请求;
- 设备重试同步;
- 二选一链路失效;
- 数据库延迟与一致性下降;
- 高负载下节点重启;
- 监控丢失;
- 恢复工具相互竞争。
目标是优雅降级。
当网络无法承接全部请求时,必须保护关键控制能力,并保留足够容量用于恢复。可通过提前拒绝请求、退避、区域分离、优先处理应急业务或隔离故障域来实现。
KDDI 报道称已将某个 VoLTE 布局从全国全网状调整为区域分离设计,并启用流控功能,以降低拥塞扩散到全网的概率。[9]
核心是故障遏制。
分布式设计可提高韧性,前提是形成独立容量;也会削弱韧性,若所有节点共享同一故障模式。全网状可能提供更多常态路径,却可能让异常信令全国扩散。区域隔离可换取更小的共性故障域,即便牺牲部分灵活性。
公开报告未能证明完整现网拓扑或全部测试结果,但提出了明确可量化的问题:
若同样的部分路由故障再次发生,多少节点、地区和订阅者会在控制阈值生效前进入拥塞?
可验证的答案应包括测试条件、观察阈值、拒绝行为、应急服务性能和影响域隔离所需的最长时间。
没有这些证据,“我们改了拓扑”只是设计陈述;若有证据,则该变化才成为韧性控制。
备份完整性与订阅者状态应纳入停运规划
备份通常被讨论为网络安全或数据丢失控制,而 KDDI 应对显示它对网络可用性同样关键。
11 月报告称,部分 VoLTE 节点读取了受损备份文件并以异常状态启动;也描述了订阅者数据库会话不一致。[9]
这使“恢复状态来源”成为核心问题。
节点重启后不一定就恢复,只有软件、配置与运行态在重启时已知健康并与系统其余部分兼容,才算恢复。
可信恢复流程应建立:
- 备份创建时间;
- 其中包含的软件与配置版本;
- 是否在拥塞或局部故障期间生成;
- 完整性是否校验;
- 是否与对端节点和订阅者状态一致;
- 谁授权使用;
- 负载下通过了哪些服务测试。
自动化故障期间生成的备份可能保留故障状态。
如果节点写入了异常状态且再次被用于恢复镜像,重启可能复现故障。若订阅者数据库副本发生分歧,恢复某一份副本会导致会话失效或进一步触发注册问题。若恢复方无法确认哪一状态具备权威性,每次纠正动作都会引入新风险。
答案不是取消自动备份,而是区分“运行时检查点”和“可独立验证的恢复点”。
关键网络功能应具备:
- 不可变或写保护的已知健康配置;
- 签名的软件与配置清单;
- 复制状态一致性校验;
- 异常条件下创建备份的隔离机制;
- 经过测试的重置流程;
- 清洁的管理路径;
- 分阶段重启与服务探测;
- 从恢复动作本身进行显式回退。
KDDI 称已修订节点重置流程并开发跨多个 VoLTE 节点检测与缓解拥塞的工具。[9] 这些措施加快恢复速度,但问责要求其同时证明状态完整性的保护能力。
对移动运营商而言,配置、订阅者状态和恢复权限都是可用性资产。无法在压力下信任的备份,不构成韧性储备。
影响数字需要纪律化解读
重大事件会产生大量大数字。不同数字回答不同问题。
KDDI 估计在非合并口径下,受影响语音用户约 2,278 万,受影响数据用户至少 765 万。含 Okinawa Cellular 后,估计为约 2,316 万语音用户和至少 775 万数据用户。该公司解释语音和数据估算基于与对比周期在通话或注册差异上的不同方法。[1][5][14]
这些数字不能相加,以“超过三千万人”对外表述。
一人可同时使用语音和数据;一份账户可包含多条号码;基于注册差异的数据估计并不等同于尝试且失败会话的用户总数。“受影响”可能包含降级、间歇中断或完全不可用,而非单一状态。
退款数字回答另一个问题。
KDDI 公布了面向条件符合者的条款性赔付,覆盖 2,710,000 名 KDDI 用户和 70,000 名 Okinawa Cellular 用户。还宣布向 KDDI 35,890,000 名用户和 660,000 名 Okinawa Cellular 用户发放 200 日元道歉退款。[1]
这类对象反映的是合同与政策决策,不是对“同期服务受损人数”的技术量化。
KDDI 披露的约 75 亿日元财务影响又是另一类指标。[11] 它反映公司在既定会计与退款假设下的预期经营后果,并不等于每一笔未完成交易、错失紧急联系、交付延迟、连接设备中断或用户时间成本。
健全的影响报告应保持四个维度:
- 服务影响:哪些功能不可用或降级。
- 实际使用观察:通话、注册与交易与正常水平相比的变化。
- 用户补偿:哪些账户符合何种退款。
- 经济后果:直接的运营成本和更广泛社会损失。
夸大某一数字会削弱分析。更有力的结论不依赖数字膨胀。
该事件是全国性、持续性且重大影响的,因为核心控制失败影响了关键移动服务及其依赖系统。准确计量应使结论更可信,而非更“戏剧化”。
应急呼叫将可用性提升为公共职责
当移动故障影响到公众可靠联系应急服务时,它就是公共安全事件。
官方国会记录提供了异常清晰的证据。记录称 KDDI 发起的 119 呼叫量在事件期约低 63%,来自非 KDDI 移动终端和其他路径的呼叫上升。KDDI 网络的 110 呼叫量约低 45%,其他运营商和公共电话的呼叫量提升。[20]
这些数字需要更谨慎的表述。
它们显示的是按起源路径观察到的通话量变化,不等于每一次尝试呼叫、每个呼叫者意图、终端是否报错、是否每次备用路径都接通或每次应急结果如何。
但该证据仍表明了依赖关系。
当全国性移动网络故障发生时,应急需求不会消失。部分用户改用其他手机、固定电话或公共电话,也有部分用户没有替代方式。生效网络上的负载增长会给幸存网络和呼叫中心带来次生风险。
因此应急通话连续性需超过普通语音可用性指标:
- 110、118、119 呼叫建立;
- 来电位置处理;
- 回拨能力;
- 优先级与拥塞处理;
- MVNO 接入;
- 残障用户可访问性;
- 地区维度表现;
- 主网故障时对用户的指引;
- 转移到替代网络的负载。
KDDI 回应称加强了与应急通话机构的沟通,并参与替代通信和运营商间漫游工作。[9][10]
这些控制应对不同问题。
更好的通知有助于监管和用户理解故障。替代路径帮助呼叫离开故障网络。两者都不能取代运营方对自身应急路径韧性的责任。
公开问责标准应与后果成比例。运营商可同时宣布普通语音恢复,却在应急呼叫定位、回拨或拥塞处理上仍不足。服务评估矩阵因此应将应急功能独立拆分,而不是把它作为“语音流量”中的一行。
实际控制被划分,但并不均匀
网络事件通常涉及多主体。问责应贴合各主体实际可预防、可发现、可限制、可披露和可修复的能力范围。
KDDI
KDDI 负责维护流程、流程文档管理、作业审批、路由配置、回退条件、网络监测、VoLTE 节点运行、订阅者数据库恢复、服务度量、客户沟通以及向监管者提交的证据。
这不等于 KDDI 控制每一类产品行为或能防止每一次故障。它表示该运营商对生产环境与恢复拥有最广泛的实际权限。
设备与软件供应商
供应商可能控制节点软件、数据库行为、重试特征、峰值文档、备份格式和技术支持。KDDI 回应称其已获得厂商信息并测试高负载行为。[9]
现有冻结记录未披露完整的供应商名单、合同条款或缺陷发现。对某个指定厂商单独归责是不负责任的。责任要求是,运营方要知道需要哪些供应商证据,并在产品行为异常时保有保护服务的权威。
行政机构与复审机构
总务省接收了重大事故报告,发布行政指导,并通过复审体系审视该事故及更广泛的通信事故问题。[3][8][9][21]
监管职责包括要求证据、设置报告预期与制定行业韧性规则,但不直接操作 KDDI 路由器或恢复订阅者状态。
应急服务、MVNO 与企业用户
这些主体掌握依赖与影响证据。MVNO 可观察其用户的附着与呼叫能力,企业可报告无法接入或失败的互联设备与物流功能,应急机构可衡量呼叫量和位置变化。
它们不控制故障的 KDDI 核心。其连续性准备可降低伤害,但不能转移核心基础设施的主要责任。
用户
用户可在可行时保留替代联系方式,但多数无法在经济上复制全国级移动服务。公共电话、Wi-Fi、第二张卡或固定电话可辅助。然而这些属于有边界的缓解,而不是对系统性核心故障的公平替代答案。
该分配有助于避免两种误区。
第一种是把系统性问题归咎于最接近的个人或组件。第二种是过度分散责任,导致无人承担主要责任。
KDDI 承担最强的问责压力,需要说明一次短时路由问题如何演化为长期全国性事件,以及这条链条如何被现行机制有效约束。
修复应以关联证据包验证
KDDI 发布了实质性纠正方案。11 月报告与后续披露包含:
- 更严格的流程文档管理;
- 带有可留存证据的专家复核;
- 修订后的审批方式;
- 更清晰的服务正常性标准;
- 纳入拥塞后的回退时机;
- 基于影响的作业风险分级;
- 更广的作业抑制规则;
- 更细颗粒度的拥塞检测工具;
- 流量路径与拓扑变更;
- 启用流控;
- 检查其他移动系统中的相似故障模式;
- 修订重置与恢复流程;
- 多节点拥塞缓解工具;
- 质量治理变更;
- 大规模演练;
- 改进对公众和利益相关方的沟通。[9][10][15][17]
这些内容有实际意义,但不应误读为“列举即充分证明”。
控制机制是相互作用的。更强的流程可防止同类路由错误,但不一定覆盖语义不同的命令;流控可保护 VoLTE 节点,但未必覆盖其他具有相似重试模式的系统;区域隔离可抑制传播,但共享订阅数据库或管理标识仍可能使风险外泄;恢复工具可更快执行,但也可能继续在未验证的状态上加载负担。
整改包应将每个已观察故障与控制和测试关联:
| 观察到的故障 | 修正控制 | 所需证明 |
|---|---|---|
| 选择了错误流程 | 版本化流程归档与专家复核 | 阻止使用过期或错误设备流程 |
| 风险评估不足 | 按影响分级 | 全国性/共模作业获得要求的审批与测试深度 |
| 回退过晚导致下游状态失控 | 基于服务健康的回退时机 | 测试显示回退早于重试与数据库阈值失控 |
| 局部路由故障引发反复信令 | 异常状态重试与流控 | 负载测试显示重试有上限并保护关键功能 |
| 拥塞扩散为全国范围 | 区域故障域与拓扑调整 | 故障注入在既定区域或容量预算内收敛 |
| 故障节点难以识别 | 按节点统计未完成请求遥测 | 定义时间内识别源节点 |
| 恢复加载受损状态 | 验证后的恢复点与重置流程 | 分阶段重启拒绝损坏状态并保持一致性 |
| 订阅会话出现分歧 | 数据库一致性与协调控制 | 恢复测试证明权威状态并限定重新注册 |
| 公开信息不足 | 事故沟通模板与专责团队 | 演练证明服务、应急与恢复信息可及时发布 |
| 备用通信受限 | 跨运营商与替代路径 | 激活测试证明语音、数据、短信与应急功能可用 |
证据应当是当前且与实际部署绑定的。
事故后的政策通过并不证明生产网已落实;某一次软件版本的实验室测试也不证明后续拓扑;一次培训签到记录也不证明指挥人员可在模糊遥测下隔离节点。
有价值的证据包括:
- 版本化作业单与流程差异;
- 拓扑与路由策略仿真;
- 按节点信令遥测;
- 数据库一致性日志;
- 备份哈希及校验结果;
- 供应商支持记录;
- 服务级探针;
- 故障注入报告;
- 独立评估;
- 剩余风险决策。
问题不在于“绝对保密”或“全部披露”。KDDI 可以保留命令语法、凭据及敏感拓扑,同时公开失败类型、控制目标、测试范围和确认结果。
对于全国运营商而言,持久修复必须对监管者、管理层、技术团队与关键客户可理解,也应能在人员和供应商更替后持续存在。
“已恢复”需要按服务单独定义矩阵
KDDI 使用与上周同期对比的流量水平作为恢复确认依据之一。[1][7]
这有用,但并不完备。
聚合流量可回升,而关键事务仍可能受阻。数据量可能看似正常,因为存量活跃用户产生更多流量,但某些设备仍不能注册。语音时长恢复后可能某些地区的呼叫建立失败仍存在,应急回拨仍可能受阻。
全国移动恢复矩阵应包括:
| 领域 | 最低证据要求 |
|---|---|
| 设备注册 | 按地区、终端与网络代次统计附着和位置更新成功率 |
| VoLTE 语音 | 呼叫建立、完成、入网可达性、切换与错误率 |
| 应急呼叫 | 110、118、119 呼叫建立、位置、回拨与拥塞处理 |
| 移动数据 | 鉴权、会话建立、DNS 解析与公网/私网可达性 |
| 短信 | 提交、队列时长、送达与失败原因 |
| 订阅者数据库 | 延迟、一致性、会话对账与副本健康 |
| MVNO 服务 | 附着、语音、数据、短信与支撑路径测量 |
| IoT 与企业 | 代表性设备注册、遥测与专网可达性 |
| 互联与漫游 | 进出站呼叫与数据交易在合作方间的表现 |
| 客户沟通 | 状态页、支持渠道与可访问的替代指引 |
每一领域都应有功能和容量阈值。
功能恢复意味着代表性事务可成功完成。容量恢复意味着服务在预期负载下不发生不稳定队列或反复退化。稳定性意味着结果持续存在。整改意味着触发类故障机制已处理并经过回放验证。
这些阶段不应共享单一时间点。
独立观察也很关键。如果监测系统依赖同一订阅数据库或正在恢复的管理面,可能只见到局部图景。外部探针、MVNO 测量、跨网运营商、应急机构和抽样用户事务可提供独立证据。
KDDI 当前网络质量说明称全国网络状态由运营中心集中监控,并采用容量、冗余与分布式设施标准。[19] 关键问题在于,这些通用控制如何在修复后测量该具体故障类。
目标不是在每名用户确认服务后才“宣布恢复”,而是定义统计与运营上可信的边界。
当公众听到“网络恢复”时,该表述应表示的不只是流量回升,而是关键功能通过命名测试、容量稳定且剩余异常透明可见。
紧急漫游是补位,而非免责
2026 年 3 月,日本主要移动运营商宣布在重大灾害和故障期间提供全国性紧急漫游服务。该服务包括带语音、受限数据和短信的完整模式,以及只限应急呼叫的模式。[22]
这对后续韧性评估具有实际意义。
它在单一运营商网络不可用时提供替代接入路径,可降低一名用户仅持一张卡就完全孤立的风险,也说明了零售竞争并不自动赋予每位用户冗余接入。
该服务存在边界。
备用运营商需具备覆盖和容量,终端需支持必要行为。该漫游服务可能提供更低速率数据;应急-only 模式可能仅支持有限功能,并且出境式或单向路径下不具备某些回拨;激活需要协调和公开指引;灾害也可能同时影响多家网络。
紧急漫游也不能修复故障网络本身。
它不应削弱以下方面:
- 内部变更控制;
- 拥塞防护;
- 订阅者状态恢复;
- 应急业务设计;
- 恢复证据;
- 对原故障网络的运营商责任。
公开记录不能证明 2022 年 KDDI 事件单独导致了 2026 年服务。国会记录显示跨运营商漫游议题在多起重大通信事故后被纳入讨论,2026 年推出为多年、跨运营商与政府协作的结果。[20][22]
面向问责的视角将漫游作为以下层级之一:
- 阻止不安全变更;
- 在主网内遏制故障;
- 恢复可信状态;
- 保障优先业务;
- 提供独立替代路径;
- 清晰说明限制。
替代方案价值最大化,需要在与主网同样拥塞和公共需求条件下进行测试。
公开记录无法证明的内容
来源材料足以支撑详细的控制分析,但不足以支持完整的私有复盘。
它们不能证明:
- 精确路由命令;
- 受影响的全部前缀或分组路径;
- 执行该作业的具体人员身份和决策过程;
- 完整审批链;
- 每个受影响节点或数据库的供应商版本;
- 是否存在供应商缺陷贡献;
- 全部重试计时和拥塞阈值;
- 各地区服务可用性;
- 每一通紧急呼叫尝试;
- 所有 MVNO、漫游、IoT 与企业影响;
- 准确客户损失;
- 当前生产配置;
- 所有已公布修复措施的独立有效性。
这些缺口不能用猜测去填补。
未解决问题可通过以下证据进行验证:
- 版本化变更工单与流程差异;
- 拓扑与路由策略仿真;
- 按节点信令遥测;
- 数据库一致性日志;
- 备份哈希与验证结果;
- 供应商支持记录;
- 服务级探针;
- 故障注入报告;
- 监管后续保障。
不确定性不应导致放弃问责,而应定义所需证据清单。
可复用的移动网络变更问责测试
KDDI 事件支持了一套可落地的高影响通信作业标准。
1. 将意图与可执行变更绑定。
批准目标、拓扑模型、流程、设备范围与精确配置差异应形成同一版本化对象。
2. 让专家复核具备证据。
复核者应看到预期网络状态、异常路径、期望输出与回退条件,而非仅命令清单。
3. 按最大全域影响分级。
审批深度应按潜在服务、地域、应急和共模影响确定。
4. 设定影响半径预算。
执行前定义最大影响节点、地区、用户、时长和下游状态规模。
5. 测试部分故障场景。
演练请求丢失、非对称路由、重复信令、响应延迟和单路失效。
6. 保护信令与身份系统。
在短时中断下,通过重试、准入和数据库需求约束,防止故障自我放大。
7. 构建真实故障域。
分布式承载应限制异常负载扩散,而不仅分摊正常流量。
8. 使回退具备服务意识。
回退条件应纳入注册、通话、数据与数据库健康,而非仅看路由配置是否复原。
9. 保护已知健康状态。
软件、配置和关键订阅恢复状态需具备独立完整性与来源可追溯性。
10. 给响应方明确权限。
团队应明确可在何时隔离节点、削峰、分区域,以及何时启用替代路径。
11. 以事务定义恢复。
分别测量注册、语音、应急、数据、短信、MVNO、IoT、企业、漫游和支撑服务。
12. 引入外部观测。
使用不依赖被恢复控制面的探针与合作方来校验。
13. 复演事故类型。
测试失败语义变体,而非仅重放触发事件的同一命令。
14. 将整改与上线状态绑定。
政策和拓扑图必须指向当前配置、测试结果、例外与剩余风险决策。
15. 保持有界替代路径。
紧急漫游、他网、固定服务、Wi-Fi 或公共电话可降低伤害,但其容量与限制必须被测试并向外明确。
16. 发布比例化问责信息。
说明失败、哪类控制变更、如何测试以及哪些问题仍待确认,在不暴露敏感命令或架构的前提下实现。
这套标准并不要求国家级网络零故障;它要求权责边界与影响边界匹配,并使恢复主张可被核验。
结论
KDDI 2022 年 7 月的中断始于一次错误路由设置。该配置在约十五分钟后被回退。然而事件持续,原因在于网络状态已发生变化。
位置注册请求反复重发,VoLTE 节点拥塞,订阅鉴权流量上升,订阅者数据库被过载并出现不一致,部分恢复状态受损。为降低信令压力,响应方分离了十八个节点中的六个。官方数据显示,语音与数据服务在全国受到约 61 小时 25 分钟影响。[1][5][9]
可得出的责任结论不是“某人犯了一个错”。
而是一次国家级网络变更本质上是一条制度控制链条:流程文档归档、专家复核、审批、影响半径分析、回退时机、异常状态设计、拥塞可观测性、备份完整性、恢复权责与服务测量,决定一次短错误是否会保持短暂。
KDDI 公布了覆盖该链条的纠正措施,应当认可并持续验证。后续应急漫游的上线为替代路径提供了有价值补充,且有明确边界。然而,无论是长清单式整改,还是外部漫游,都不能替代对原故障类的主网络修复证明。
对于关键移动基础设施而言,旧路由恢复不足以结束问题。运营商必须证明信令体系稳定、订阅状态可信、关键通话可用、替代方案真实可行,并防止下一次高影响变更再次越过既定边界而不自知。
这正是路由回退后那 61 小时后产生的问责考验。
来源
- https://www.kddi.com/english/important-news/20220729_01/
- https://www.kddi.com/important-news/20220729_01/
- https://news.kddi.com/kddi/corporate/english/ir-news/2022/08/05/6189.html
- https://news.kddi.com/kddi/corporate/newsrelease/2022/07/29/6183.html
- https://www.kddi.com/extlib/files/english/corporate/ir/library/presentation/2023/pdf/kddi_220729_e_shougai_qe3B6V.pdf
- https://www.kddi.com/extlib/files/corporate/ir/library/presentation/2023/pdf/2023/220729-shougai.pdf
- https://www.notice.kddi.com/news/mainte/content/syougai/fre_00034454.html
- https://news.kddi.com/kddi/corporate/newsrelease/2022/11/02/6361.html
- https://news.kddi.com/kddi/corporate/newsrelease/2022/11/02/pdf/press_20221102.pdf
- https://news.kddi.com/kddi/corporate/english/ir-news/2022/11/02/pdf/kddi_221102_e_main_nQWHTi.pdf
- https://news.kddi.com/kddi/corporate/english/ir-news/2022/07/29/pdf/kddi_220729_e_statement_full_jOLDLZ.pdf
- https://www.kddi.com/english/corporate/ir/ir-library/sustainability-integrated-report/2022-online/
- https://www.kddi.com/extlib/files/english/corporate/ir/ir-library/sustainability-integrated-report/2022-online/pdf/kddi_sir2022_e06.pdf
- https://www.kddi.com/extlib/files/english/corporate/ir/ir-library/sustainability-integrated-report/pdf/kddi_sir2022_e_p.pdf
- https://www.kddi.com/extlib/files/english/corporate/ir/ir-library/sustainability-integrated-report/pdf/kddi_sir2023_e_p.pdf
- https://www.kddi.com/english/corporate/ir/ir-library/sustainability-integrated-report/2022-online/ceo_message_lookback/
- https://newsroom.kddi.com/news/detail/kddi_pr-907.html
- https://www.kddi.com/english/corporate/sustainability/governance/risk-management/
- https://www.kddi.com/english/corporate/sustainability/society/network/
- https://www.shugiin.go.jp/internet/itdb_kaigiroku.nsf/html/kaigiroku/009421020221027002.htm
- https://public-comment.e-gov.go.jp/pcm/download?seqNo=0000251103
- https://newsroom.kddi.com/english/news/detail/kddi_nr-958_4373.html
会员简报
档案背景详情
使用相应会员等级登录,即可解锁完整简报与来源注释。
仅限 Strategic Circle
Strategic Circle
所有读者均可浏览。加入并登录后可解锁档案简报。
加入 Strategic Circle仅限 Leadership Alliance
Leadership Alliance
符合条件的 IP 资产所有者和管理层可登录查看 Leadership Alliance 简报。
加入 Leadership Alliance
