摘要

  • 故障约于日本标准时间 2022 年 7 月 2 日 01:35 开始。当时 KDDI 正在多摩网络中心维护全国传输核心路由器,一份错误或过时的作业规程漏掉了 VoLTE 路由变更,造成约二分之一响应失败的间歇状态,并诱发大量位置登记重试。
  • 重试负载通过分布式 VoLTE 呼叫控制系统向全国扩散,并与用户数据库拥塞相互强化。六个呼叫控制节点曾在内部认证会话状态不一致时写入备份,随后从这些备份重启,异常状态因而没有被可靠清除。
  • 恢复并非简单撤销路由变更。KDDI 先后实施连接与 VoLTE 流量控制、呼叫控制功能重启、PGW 隔离和会话重置、用户数据库负载重分配,最后隔离六个持续异常的 VoLTE 节点,才切断顽固的信令来源。
  • 官方所列服务受影响时段为 61 小时 25 分钟,即从 7 月 2 日 01:35 至 7 月 4 日 15:00;全通信网络最终确认正常运行则是在 7 月 5 日 15:36,距开始约 86 小时。两组时间衡量的是不同阶段,不能互相替代。
  • 日本总务省将此事作为重大事故核查,指出规程管理、风险评估、拥塞设计、高负载重启测试、复杂恢复、演练和公众沟通等方面的不足。KDDI 的退款和整改措施属于运营商回应,不是监管机关罚款,也不是法院对责任作出的判决。

一场故障有两座必须分开的时钟

KDDI 将通信故障起点定在 2022 年 7 月 2 日星期六 01:35 左右。公司后来的综合说明把服务受影响时段终点列为 7 月 4 日星期一 15:00,共 61 小时 25 分钟;日本总务省的专项核查也采用了这一影响窗口。

但这不是最后一个时间点。共同社报道,KDDI 直到 7 月 5 日星期二 15:36 才确认所有通信网络完全正常运行。从事故开始计算,这一最终确认大约发生在 86 小时后。前一个时钟回答“被认定的服务影响持续多久”,后一个时钟回答“何时完成全网运行确认”。把 86 小时写成官方影响窗口会改变原始定义,只写 61 小时 25 分钟又会抹去后续解除限制、校正状态和观察稳定性的过程。

这段时间差揭示了恢复报告最容易失真的地方。路由修正可以完成,设备可以重新启动,主要数据路径也可能先恢复,但语音成功率、位置登记、用户会话、流量限制和依赖业务未必同时正常。一个“已恢复”的词,若没有对应的运行指标,就会把多个技术阶段压成一句无法核验的承诺。

受影响人数也必须保留各自的来源和统计时点。总务省核查报告估算,语音受影响者约 2,316 万人,数据受影响者至少 775 万人。KDDI 后来的综合页面给出的数字略有不同:语音约 2,278 万人,数据至少 765 万人。路透社在详细原因仍处于调查阶段时报道的则是最多 3,915 万用户可能受到影响,其中包括 26 万企业客户。

这些数字不能平均、相加或悄然拼成一个所谓最终总数。早期数字描述潜在暴露规模,后两组数字来自不同时间点的官方估算;语音与数据人群还可能重叠。用户、合同、连接和服务尝试也不是同一种计量单位。保留归属和方法,才不会让文章自己制造一项来源从未提出的统计结论。

被遗漏的路由变更制造了危险的“半失效”

事故发生时,KDDI 正在多摩网络中心对全国传输核心路由器进行维护。总务省的技术核查认为,作业采用了一份错误或过时的规程,规程中没有要求执行必要的 VoLTE 路由变更。于是,语音控制流量仍被送往一个已不能按预期工作的路径。

关键不在于这条路径彻底中断,而在于它呈现间歇性失败。核查重建的状态显示,相关响应约有二分之一不能正常返回。彻底失败往往容易触发明确告警或切换;时好时坏的路径却可能让终端和网络功能继续尝试原有方向,因为每一次偶然成功都在暗示路径仍可使用。

VoLTE 语音依赖位置登记。终端需要向网络证明用户身份并登记当前位置,之后才能正常呼入和呼出。当确认响应没有返回时,终端和网络功能会把登记视为未完成并再次发送请求。单个终端重试是合理行为,但当数百万终端和分布式控制功能同时做出同样选择时,重试本身就会成为新的故障负载。

丢失一个响应,会产生下一次请求;新增请求占用更多呼叫控制和用户数据库容量;容量下降,又使更多响应失败;失败再触发更多重试。初始路由错误由此转化为自我强化的控制面拥塞。总务省估算,多摩的 VoLTE 呼叫控制功能承受了约为平时 7 倍的负载,其他 VoLTE 站点约为平时 6.5 倍。一个本地维护错误进入了全国耦合的系统。

这也是问责分析的第一条边界:作业规程解释了异常流量为何出现,却不能独自解释故障为何扩散到全国并持续数日。后者取决于在线拓扑如何分配信令、重试规则如何响应部分失败,以及拥塞保护是否能识别并隔离这种并非全断的异常状态。这不是 BGP 泄漏、路由劫持、网络攻击、DNS 事故、频谱中断或单纯硬件故障,不能用这些更醒目的标签替代已查明的机制。

VoLTE 重试与用户数据库形成反馈回路

呼叫控制节点并不是孤立运行的。位置登记和语音会话建立还依赖用于认证、策略、计费以及位置或服务状态的用户数据库。VoLTE 重试增加后,发往这些数据库的请求也随之增加。数据库拥塞产生错误响应,错误又促使终端和网络功能发出新请求,进一步加重拥塞。

总务省还发现,部分终端的行为会使语音会话建立失败影响其登记状态。因此,即使数据业务对应的用户数据库并非最初的拥塞点,一些设备的数据可用性也会间歇受损。准确的表述应当是:全国性通信故障同时影响语音、短信,并对数据产生与终端行为或流量控制有关的影响;证据不支持“全国所有移动数据在整个时段持续不可用”这一说法。

高负载还破坏了控制状态的一致性。反复变化的认证会话未能在部分 VoLTE 呼叫控制节点内部正确同步。六个节点在内部状态不一致时写入了周期性备份。运营人员后来用最新备份重启呼叫控制功能时,这六个节点把异常状态一并带回运行环境。

因此,“重启成功”并不等于“恢复成功”。设备确实重新启动了,但它载入的状态仍会造成认证失败和位置登记重试。原本用于清除故障的动作反而保留了故障的一部分,因为恢复所依赖的记录本身来自一个正在拥塞、尚未收敛的系统。

VoLTE 功能、用户数据库与分组数据网关 PGW 之间还出现了会话不一致。在数据库拥塞期间,本应删除的会话信息并不总能被删除,后来的新会话便可能与遗留状态冲突。解决这类矛盾不能只盯住某一台设备是否在线,还必须让多个系统在有限容量下逐步收敛到同一个真实状态。

这起事故最深的运行启示就在这里:备份是一项记录,却不天然代表可恢复的干净状态;重置是一条命令,也不天然证明在线系统已经恢复。真正需要的,是对路由、应答、重试、同步、会话和端到端服务结果的持续观测。文件和规程只能说明计划做什么,在线网络的行为才决定通信是否真的连续。

恢复是一组相互依赖的动作

KDDI 的处置包含多类干预。总务省列出了连接请求和 VoLTE 流量控制、呼叫控制功能重启、隔离部分 PGW 以减轻用户数据库负载、重置 PGW 会话以修正不一致信息,以及调整由哪些用户数据库资源承接 PGW 流量。

这些动作分别作用于反馈回路的不同位置。流量控制减少新需求;PGW 隔离和会话重置改变用户系统看到的状态;负载重分配防止单一路径继续成为瓶颈;呼叫控制重启试图清除异常处理。把其中任一项写成“解决方案”,都会遗漏恢复链条的其他必要环节。

最棘手的是六个持续异常的 VoLTE 呼叫控制节点。总务省指出,由于节点已经处于异常状态,尝试执行的阻断处理没有正常完成。即使其他措施已降低部分负载,这些节点仍持续发出过量信令。直到它们最终被隔离,这一顽固的重试来源才停止,拥塞随后逐步消退。

这段顺序解释了为什么维修工作完成与服务恢复不是同义词。运营商可以完成既定的物理或配置操作,在线网络却仍然拥塞;大部分数据路径可以先恢复,语音仍受限制;呼叫成功率可以回升,但在长时间高负载后,团队仍需检查所有相关系统是否留下隐藏状态。

总务省后来批评了 KDDI 对“恢复作业完成”和“服务全面恢复”的区分方式。KDDI 原意是:作业完成后还要解除流量控制并确认正常。但部分用户和媒体把“恢复作业完成”理解为服务已经恢复,而当时拥塞和流量限制仍在继续。

这不仅是措辞问题,更是测量问题透过措辞暴露出来。如果状态体系无法说明哪些技术条件和用户结果已经通过,公告就只能依赖含糊的里程碑。更可靠的更新应分别说明:初始故障已移除、重试增长已受控、拥塞正在消退、会话状态已经一致、流量限制已解除、语音和数据成功率已稳定、端到端依赖业务已完成检查。

影响越过手机屏幕,进入公共服务链条

KDDI 的说明列出了配送状态与司机通信、联网汽车、气象数据采集、水表、银行自动柜员机、机场无线通信和公交支付等受到的影响。路透社也独立报道了气象数据、包裹配送、银行和联网汽车方面的中断。

这些例子说明,移动核心网不仅承载个人通话,也可能是其他业务的控制或上报通道。对个人而言,故障表现为电话无法拨出;对物流企业而言,可能是司机状态无法回传;对公共机构而言,可能是观测数据缺失;对交通或银行系统而言,则可能是远端设备无法完成日常交易。

但这里同样存在清楚的证据边界。所列案例证明依赖关系的覆盖范围,并不证明每一种服务在全国范围内、在整个事故窗口中都持续失效。每个依赖业务的具体时钟和影响程度,不能从移动网络总体故障时间直接推导。

紧急呼叫带来最尖锐的连续性问题。路透社报道,日本总务大臣担忧用于保护生命和财产的消防与紧急呼叫受到妨碍;共同社后来报道,一些用户曾在较长时间内无法拨打 110 或 119。现有公开资料没有给出失败呼叫次数、独立紧急事件数量,也没有证明具体伤亡。

这些空白不应由推测填补。已经能够成立的结论足够严肃:在一次持续较久的全国移动通信故障中,紧急号码的可达性受到影响。问责重点应放在运营商能否证明,当语音登记、用户认证或普通流量控制发生故障时,紧急通信仍有可生存的路径和受到保护的容量。

重大事故核查指出控制缺口,却不是司法裁决

日本总务省把这起事件作为重大事故处理,并组织专项技术核查。核查没有把原因压缩为某一个人的错误,而是指出了多层控制不足:规程选择和审批、服务正常性确认、风险评估、拥塞控制设计、全国扩散影响评估、高负载条件下的重启测试、复杂恢复程序、事故演练以及面向用户的信息发布。

这种分层结论很重要。错误规程可以点燃事故,但全国网络的韧性必须建立在“规程和人员都可能出错”的现实上。系统需要识别部分响应失败,限制重试行为,为分布式架构设置隔离边界,在异常负载下检验备份和重启,并让运维团队演练如何离开自动化无法自行消解的状态。

KDDI 后来报告的措施包括强化规程与审批、改进拥塞检测、复查拥塞控制设计、调整恢复程序和工具,以及改善客户信息发布。这些措施与查明的故障路径相呼应,但公开资料并未提供截至 2026 年对其成效和全网覆盖范围的独立验证。报告“已采取”不能替代在线系统“已证明有效”。

KDDI 还宣布了客户补偿。其综合页面把依据条款、针对连续超过 24 小时完全无法使用通信或符合相当条件的退款,与面向更大客户群的 200 日元致歉退款分开说明。共同社报道,预计补偿成本约为 73 亿日元,并提到 KDDI 社长自愿减薪。

这些属于运营商的补偿和治理回应。它们不是监管机关施加的金钱罚款,不是刑事处理,也不是法院对法律责任作出的认定。公开资料能够支持的,是重大事故分类、总务省核查发现、运营商报告的整改措施和补偿安排;不能把这些事实改写为资料没有记载的司法结论,也不能据此归咎某一个人。

连续性证据必须描述正在运行的服务

从这起事故可以建立三层证据。第一层是预期状态:获批的作业规程、应当采用的路由、配置好的拥塞控制、恢复方案和客户通知政策。这些记录不可或缺,却只能说明组织打算让系统如何工作。

第二层是观测到的技术状态。运营商必须知道 VoLTE 信令实际走哪条路径、确认响应是否返回、重试被分配到哪些呼叫控制节点、节点之间是否同步、用户与 PGW 会话是否一致,以及重启载入的备份是否来自干净状态。它们回答的不是“文件写了什么”,而是“网络现在正在做什么”。

第三层是服务结果。节点健康并不能证明用户可以完成登记、拨出和接听电话、发送短信、使用数据或联系紧急中心。恢复需要在有代表性的终端、地区、业务和依赖机构之间做端到端检查,公众里程碑也应跟随这些结果,而不是跟随某一条命令的返回值。

监管报告保存了关键事实账目:术语、数字、时间线、原因和整改要求。但报告本身不能承载流量、抑制重试、校正会话或让紧急电话接通。它的运行价值,在于把过去事故转化为今天必须完成的测试和可以公开说明的指标。

所以,KDDI 2022 年故障留下的决定性问题,不是原始路由最终有没有被纠正,而是当前控制能否证明:类似的间歇失败会被限制在局部,重试需求不会无限放大,恢复所用状态可信,操作人员仍保有观测和处置能力,而公开状态语言与用户能够实际完成的通信一致。

公开资料没有证明什么

总务省报告提供了细致的技术重建,但公开资料没有展示全部内部日志、每一道恢复命令、每一个决策责任人或完整的逐设备影响统计。它没有量化失败的紧急呼叫、独立紧急事件、伤亡或经济损失。

不同时间点的官方影响估算也发生过变化。这不意味着资料不可使用,而是要求每项数字始终带着发布者和统计时点。早期最多 3,915 万人的说法属于事件仍在调查时的潜在暴露;总务省的语音约 2,316 万、数据至少 775 万属于核查报告;KDDI 后来的语音约 2,278 万、数据至少 765 万则属于运营商综合页面。三组统计各自成立,却不能被揉成一个新数字。

同样,2022 年列出的整改措施不能单独证明今天的实际效果。工具可能已经部署,却未覆盖每个相关节点;规程可能已经修改,却未在间歇丢失与全国重试压力下受过检验;演练可能在实验条件下通过,却未复现用户状态不一致的复杂情形。

承认这些限制不会削弱问责,反而让结论停留在可证明的现实层面:事故由具体的维护和路由遗漏开始,通过可观察的重试与拥塞机制扩散,在不一致状态中延续,触及关键依赖业务,并需要多阶段处置才能恢复。负责任的判断应指向控制和证据,而不是虚构损害、法律结论或个人过错。

来源