Resumen

  • El incidente comenzó hacia la 01:35 JST del 2 de julio de 2022 durante el mantenimiento de un router del núcleo nacional de transporte en el centro de red de Tama. Una instrucción errónea u obsoleta omitía el cambio de encaminamiento necesario para VoLTE, lo que dejó un fallo intermitente de respuesta y provocó solicitudes repetidas de registro de ubicación.
  • La carga de los reintentos se propagó por el control distribuido de llamadas VoLTE y las bases de datos de abonados. Seis nodos de control reiniciaron después desde copias escritas cuando su estado interno era incoherente, por lo que el reinicio no garantizó una condición limpia.
  • Recuperar la red exigió más que revertir el cambio de ruta. KDDI aplicó controles de flujo, reinicios del control de llamadas, aislamiento de PGW y reinicio de sesiones, redistribución de carga entre bases de abonados y, finalmente, aislamiento de seis nodos VoLTE que seguían en un estado anómalo.
  • El periodo oficial de servicio afectado duró 61 horas y 25 minutos, desde la 01:35 del 2 de julio hasta las 15:00 del día 4. KDDI no confirmó que todas sus redes de telecomunicaciones funcionaban plenamente hasta las 15:36 del 5 de julio, unas 86 horas después del comienzo. Son dos relojes operativos distintos.
  • El Ministerio de Asuntos Internos y Comunicaciones de Japón trató el suceso como un accidente grave y detectó deficiencias en el control de procedimientos, el diseño frente a la congestión, las pruebas de recuperación con carga alta, los simulacros y la comunicación pública. Los reembolsos y las medidas anunciadas por KDDI fueron respuestas del operador, no una multa impuesta por el regulador ni una sentencia judicial.

Dos cronologías que no deben mezclarse

KDDI sitúa el inicio del fallo de comunicaciones en torno a la 01:35, hora estándar de Japón, del sábado 2 de julio de 2022. Su página consolidada fija el final del periodo de afectación a las 15:00 del lunes 4 de julio. El Ministerio de Asuntos Internos y Comunicaciones, o MIC, utiliza el mismo intervalo en su informe de verificación: 61 horas y 25 minutos.

Kyodo documentó un hito posterior. KDDI confirmó que todas las redes de telecomunicaciones estaban plenamente operativas a las 15:36 del martes 5 de julio, aproximadamente 86 horas después del inicio. El intervalo largo no sustituye al periodo oficial de servicio afectado; el corto tampoco elimina el tiempo adicional dedicado a retirar restricciones, comprobar la estabilidad y confirmar la normalización de todos los sistemas.

Entre ambas referencias hubo varios estados: eliminación de la causa inicial, descenso de los reintentos, descongestión, conciliación de sesiones, retirada gradual de los controles de flujo, estabilización de voz y datos y observación final. Encerrar toda la secuencia en la palabra «restablecido» borra la información que los usuarios y los servicios dependientes necesitan para decidir.

Las cifras de impacto también pertenecen a momentos y autores concretos. El MIC estimó unos 23,16 millones de afectados en voz y al menos 7,75 millones en datos. La página consolidada que KDDI publicó después informó de unos 22,78 millones en voz y al menos 7,65 millones en datos. Reuters, cuando la investigación técnica aún no había terminado, citó una exposición potencial de hasta 39,15 millones de usuarios, incluidos 260.000 clientes empresariales.

No es correcto sumar ni promediar esas cantidades. Las poblaciones de voz y datos pueden solaparse; personas, contratos, conexiones e intentos de servicio no son unidades equivalentes. Los 39,15 millones describían una estimación temprana de exposición potencial, no la cifra final de personas que se determinó que habían sufrido el fallo.

La omisión de una ruta creó un fallo parcial

La secuencia técnica comenzó durante el mantenimiento de un router del núcleo nacional de transporte en el centro de Tama. Según la reconstrucción del MIC, el trabajo se realizó con un procedimiento incorrecto u obsoleto. La instrucción no incluía la modificación de encaminamiento requerida para el tráfico VoLTE, que siguió dirigiéndose hacia un recorrido que ya no respondía como estaba previsto.

No se produjo una pérdida total y limpia. El MIC reconstruyó una situación en la que aproximadamente una de cada dos respuestas del recorrido afectado fallaba. Esa intermitencia fue decisiva. Ante una ausencia completa de respuesta, una función puede declarar una avería inequívoca y cambiar a una alternativa conocida. Si unas solicitudes funcionan y otras no, el recorrido puede parecer lo bastante vivo como para seguir recibiendo tráfico.

La voz sobre LTE depende del registro de ubicación. El terminal debe acreditar al abonado y registrar dónde está disponible antes de completar con normalidad llamadas entrantes o salientes. Cuando no llegaba la confirmación esperada, terminales y funciones de red consideraban incompleto el registro y volvían a intentarlo.

Cada reintento tenía sentido visto desde un dispositivo aislado. Millones de decisiones idénticas, junto con las de las funciones distribuidas, convirtieron esa lógica en una fuente adicional de carga. Cada respuesta perdida generaba otra solicitud; cada solicitud consumía más capacidad de control de llamadas y de bases de abonados; al disminuir la capacidad, fallaban más solicitudes y nacían nuevos reintentos.

El MIC calculó que las funciones VoLTE de Tama soportaron alrededor de siete veces la carga normal. Otros emplazamientos VoLTE llegaron aproximadamente a 6,5 veces la carga normal debido a la distribución nacional del trabajo. Esos factores miden carga técnica, no porcentajes de clientes afectados.

El registro técnico no describe el episodio como una fuga BGP, un secuestro de rutas, un ciberataque, un incidente DNS, una indisponibilidad de espectro o una simple avería de equipo. El origen fue la omisión del cambio de ruta VoLTE en una tarea de mantenimiento; el alcance nacional se explica por la reacción posterior de la red en funcionamiento.

La congestión enlazó VoLTE con el estado de los abonados

Los nodos de control de llamadas dependían de bases de abonados para la autenticación, las políticas y el estado de ubicación o de servicio. A medida que crecían las solicitudes de VoLTE, también aumentaba el trabajo que recibían esas bases.

El MIC describe una dinámica que se reforzaba a sí misma. La congestión de las bases producía respuestas de error. Los errores llevaban a dispositivos y funciones a volver a solicitar el registro. La nueva demanda causaba todavía más congestión. El comportamiento de algunos terminales vinculaba además el fracaso de la sesión de voz con su estado de registro, de manera que el acceso a datos podía volverse intermitente aunque la base específica de datos no fuese el foco original de saturación.

Esa precisión importa: los elementos disponibles no demuestran que todos los datos móviles estuviesen ininterrumpidamente fuera de servicio en todo Japón. Sí muestran un fallo nacional de comunicaciones con efectos sobre voz, SMS y datos dependientes del dispositivo o de los controles de flujo. Distintos usuarios podían experimentar síntomas diferentes al mismo tiempo.

La carga elevada también dañó la coherencia del estado de control. Los cambios reiterados en las sesiones de autenticación no se sincronizaron correctamente dentro de algunas funciones VoLTE. Seis nodos guardaron copias periódicas mientras su estado interno era incoherente. Al reiniciarlos con las copias más recientes, reapareció parte del comportamiento anómalo.

Reiniciar no equivalía a recuperar. Los equipos volvían a arrancar, pero el estado cargado seguía generando fallos de autenticación y solicitudes repetidas. También aparecieron discrepancias entre las funciones VoLTE, las bases de abonados y las pasarelas de paquetes PGW. Cuando la base estaba congestionada, cierta información de sesión que debía borrarse permanecía; una sesión nueva podía entonces chocar con ese estado residual.

La enseñanza operativa es concreta. Una copia acredita que se conservó un estado, no que ese estado sea sano. Una orden terminada demuestra que una acción se ejecutó, no que el servicio haya vuelto a una condición coherente. La recuperación necesita medidas que revelen qué están haciendo realmente las rutas, las sesiones y las funciones de control después de intervenir.

La recuperación fue una secuencia, no una sola maniobra

La respuesta de KDDI actuó sobre varias partes del bucle. Incluyó limitaciones de las solicitudes de conexión y del tráfico VoLTE, reinicios de las funciones de control de llamadas, aislamiento de algunos PGW para reducir la carga de las bases de abonados, reinicio de sesiones PGW para corregir información incompatible y redistribución de los flujos hacia los recursos de esas bases.

Cada acción atacó un mecanismo diferente. Los controles de flujo frenaban la llegada de demanda. El aislamiento y los reinicios de PGW modificaban el estado que veían los sistemas de abonados. La redistribución impedía que un único recorrido de base de datos siguiera siendo el cuello de botella. Los reinicios del control de llamadas intentaban limpiar el procesamiento anómalo. Ninguna acción representa por sí sola toda la recuperación.

Los seis nodos VoLTE que mantuvieron un estado anómalo fueron especialmente difíciles. El MIC concluyó que un intento de bloqueo no terminó de manera normal porque los nodos ya estaban perturbados. Siguieron generando señalización excesiva incluso después de reducir otras fuentes de carga. Solo su aislamiento efectivo eliminó esa fuente persistente; a continuación, la congestión empezó a ceder.

La secuencia revela por qué terminar una reparación no basta para declarar que terminó el riesgo. La configuración prevista puede estar corregida y la red activa seguir congestionada. La mayoría de las rutas de datos puede funcionar mientras la voz continúa limitada. La tasa de éxito de llamadas puede normalizarse y aun así ser necesario revisar cada sistema relevante en busca de estado oculto tras muchas horas de carga extrema.

El MIC criticó la distinción que KDDI comunicó entre el final de los trabajos de recuperación y la reanudación plena del servicio. KDDI pretendía retirar después los controles de flujo y confirmar la normalidad; algunos usuarios y medios entendieron que el servicio ya estaba recuperado. En realidad, persistían la congestión y determinadas restricciones.

No fue solo un problema de redacción. Las palabras dejaron al descubierto un problema de medición. Un modelo de incidentes más sólido publica hitos separados para retirar la causa, contener los reintentos, despejar la congestión, conciliar sesiones, levantar controles de flujo, estabilizar voz y datos y comprobar de extremo a extremo los servicios que dependen de la red.

La interrupción alcanzó servicios más allá de los teléfonos

KDDI enumeró efectos en actualizaciones de reparto y comunicaciones con conductores, vehículos conectados, recogida de datos meteorológicos, contadores de agua, cajeros bancarios, comunicaciones inalámbricas de aeropuertos y pagos en autobuses. Reuters informó de forma independiente de perturbaciones en meteorología, paquetería, banca y vehículos conectados.

Los ejemplos muestran que una conexión móvil puede ser el camino de control o de información de otro servicio. Para una persona, el fallo visible es no poder llamar. Para una empresa logística, puede ser la ausencia de estados de reparto. Para un organismo público, son observaciones que no llegan. Para un servicio bancario o de transporte, puede ser un terminal remoto incapaz de completar una operación ordinaria.

El alcance debe expresarse con cautela. La información no establece que todos los servicios citados fallaran en todo el país durante las 61 horas y 25 minutos. Demuestra una red extensa de dependencias, no un reloj único para cada sector.

La consecuencia más delicada fue la comunicación de emergencia. Reuters recogió la preocupación del ministro de Comunicaciones porque se habían obstaculizado llamadas de bomberos y emergencias destinadas a proteger vidas y bienes. Kyodo informó después de que algunos usuarios no pudieron marcar el 110 o el 119 durante un periodo prolongado.

No hay, sin embargo, una cifra pública de intentos de emergencia fallidos, emergencias únicas, heridos o fallecidos. Tampoco existe una cuantificación respaldada de la pérdida económica total. No corresponde llenar esos vacíos con estimaciones. El hallazgo sustentado ya es serio: el acceso a números de emergencia quedó perjudicado durante una prolongada interrupción móvil de alcance nacional.

El accidente grave no equivale a una condena

El MIC trató el suceso como un accidente grave y convocó una verificación técnica específica. Su informe no redujo la causa a un único error humano. Encontró deficiencias en la selección y aprobación de procedimientos, las comprobaciones de normalidad, la evaluación de riesgos, el diseño contra la congestión, el análisis de propagación nacional, las pruebas de reinicio con carga alta, los métodos de recuperación compleja, los ejercicios y la información al cliente.

La amplitud de las conclusiones es importante. Una instrucción incorrecta puede iniciar un episodio, pero la resiliencia nacional depende de controles que asuman que los procedimientos y las personas fallarán alguna vez. Los estados de respuesta parcial deben ser visibles. Los reintentos tienen que estar acotados. La arquitectura distribuida necesita zonas de contención. Las copias y los reinicios deben probarse bajo carga anómala. Los equipos requieren una salida ensayada para condiciones que la automatización habitual no resuelve.

KDDI comunicó cambios en el control y aprobación de las tareas, una detección de congestión reforzada, una revisión de los mecanismos de limitación, nuevos procedimientos y herramientas de recuperación y mejoras en la información a los clientes. Esas respuestas se corresponden con los caminos de fallo documentados. El registro público no ofrece una prueba actual, independiente y para toda la flota de su eficacia en 2026.

La compañía también anunció compensaciones. Su página diferencia los reembolsos previstos por las condiciones del servicio para clientes sin ninguna comunicación durante más de 24 horas seguidas, o en una situación equivalente, de un reembolso de disculpa de 200 yenes para un grupo mucho mayor. Kyodo estimó un coste de unos 7.300 millones de yenes e informó de una reducción voluntaria del salario del presidente de KDDI.

Son respuestas comerciales y de gobierno corporativo del operador. No son una multa monetaria del regulador, una resolución penal ni una declaración judicial de responsabilidad. La información respalda la clasificación de accidente grave, los hallazgos técnicos del MIC, las medidas comunicadas y el programa de compensación; no permite convertirlos en una sentencia que no existe en esos documentos.

La continuidad se demuestra en el servicio que está funcionando

El incidente sugiere tres niveles de evidencia. El primero es el estado previsto: procedimiento aprobado, ruta esperada, controles de congestión configurados, plan de recuperación y política de información. Todo ello importa, pero no acredita por sí solo la continuidad.

El segundo nivel es el estado técnico observado. El operador necesita saber por dónde circula realmente la señalización VoLTE, si regresan las respuestas, cómo se distribuyen los reintentos, qué nodos están sincronizados, si coinciden los estados de abonado y PGW y si un reinicio cargó una copia sana. Esas mediciones muestran lo que hace la red, no lo que los documentos dicen que debería hacer.

El nivel superior es el resultado de servicio. Un nodo sano no prueba que las personas puedan registrarse, llamar, recibir llamadas, enviar mensajes, usar datos o llegar a un centro de emergencias. La recuperación exige comprobaciones de extremo a extremo sobre dispositivos, regiones, servicios y organizaciones dependientes que sean representativos. El hito público debe seguir a esos resultados.

El informe regulatorio conserva una memoria indispensable de lo ocurrido. Fija terminología, cifras, cronología y expectativas correctivas. Pero no transporta tráfico, no frena los reintentos, no concilia sesiones ni completa una llamada de emergencia. Su valor operativo está en las pruebas que obliga a plantear a la red activa.

Por eso, la pregunta decisiva después de 2022 no es si se corrigió la ruta original. Es si los controles actuales pueden demostrar que otro fallo intermitente quedaría localizado, que la demanda de reintentos permanecería limitada, que los datos de recuperación serían fiables, que los equipos conservarían visibilidad y que el lenguaje público correspondería a resultados observables por los usuarios.

Lo que la información pública no establece

El informe del MIC ofrece una reconstrucción detallada, pero la información abierta no muestra todos los registros internos, cada orden de recuperación, todos los responsables de decisión ni los resultados para cada dispositivo. No cuantifica los fallos de llamadas de emergencia, los daños personales o la pérdida económica.

Las cifras oficiales variaron entre momentos de publicación. Eso no las invalida, pero obliga a mantener su atribución y su método. Tampoco una lista de medidas implantadas o previstas en 2022 demuestra su eficacia presente. Una herramienta puede estar desplegada sin cubrir todos los nodos; una instrucción puede cambiar sin haberse probado frente a pérdida intermitente y carga nacional; un simulacro puede aprobarse sin reproducir estados de abonado incoherentes.

Estos límites hacen más sólida la conclusión. La crisis empezó con un fallo concreto de mantenimiento y encaminamiento, se extendió mediante mecanismos observables de reintento y congestión, persistió a través de estados incompatibles, alcanzó dependencias críticas y requirió una recuperación en varias etapas. La responsabilidad debe evaluarse por controles y resultados demostrables, no por daños inventados ni culpas personales no acreditadas.

Fuentes