Résumé
- L’incident a commencé vers 01 h 35 JST le 2 juillet 2022 pendant la maintenance d’un routeur du cœur de transport national au centre réseau de Tama. Une instruction erronée ou obsolète omettait la modification de routage nécessaire à la VoLTE, d’où une perte de réponse intermittente et des demandes répétées d’enregistrement de localisation.
- La charge des nouvelles tentatives s’est propagée aux fonctions distribuées de contrôle d’appel VoLTE et aux bases d’abonnés. Six nœuds de contrôle ont ensuite redémarré depuis des sauvegardes écrites alors que leur état interne était incohérent, de sorte que le redémarrage n’a pas garanti un retour à un état sain.
- Le rétablissement ne s’est pas limité à corriger le routage. Il a combiné limitation des flux, redémarrage de fonctions de contrôle d’appel, isolement de PGW et réinitialisation de sessions, redistribution de la charge des bases d’abonnés, puis isolement de six nœuds VoLTE durablement anormaux.
- La période officielle de service affecté a duré 61 heures et 25 minutes, de 01 h 35 le 2 juillet à 15 h 00 le 4 juillet. KDDI n’a confirmé le fonctionnement normal de tous ses réseaux de télécommunications qu’à 15 h 36 le 5 juillet, soit environ 86 heures après le début. Ces deux durées répondent à des questions différentes.
- Le ministère japonais des Affaires intérieures et des Communications a qualifié l’événement d’accident grave et relevé des lacunes dans la maîtrise des procédures, la conception face à la congestion, les essais de reprise sous forte charge, les exercices et l’information du public. Les remboursements et mesures annoncées par KDDI sont des réponses de l’opérateur, non une amende du régulateur ni une décision de justice.
Deux chronologies qu’il ne faut pas confondre
KDDI situe le début de la défaillance des communications vers 01 h 35, heure normale du Japon, le samedi 2 juillet 2022. Sa synthèse ultérieure fixe la fin de la période de service affecté à 15 h 00 le lundi 4 juillet. Le ministère des Affaires intérieures et des Communications, ci-après MIC, retient le même intervalle dans son rapport de vérification : 61 heures et 25 minutes.
Un autre jalon arrive plus tard. Kyodo rapporte que KDDI a confirmé le fonctionnement complet de tous les réseaux de télécommunications à 15 h 36 le mardi 5 juillet, environ 86 heures après le début de l’incident. La durée longue ne remplace pas la période officielle d’affectation du service ; la durée courte n’efface pas non plus le temps consacré à lever les restrictions, vérifier la stabilité et confirmer la normalisation de l’ensemble du réseau.
Entre ces deux repères se trouvent plusieurs états distincts : correction de l’entrée défectueuse, ralentissement des nouvelles tentatives, décrue de la congestion, rapprochement des états de session, levée progressive des limitations de trafic, stabilisation des appels et des données, puis observation finale. Employer un seul mot comme « rétabli » pour l’ensemble de cette séquence fait disparaître l’information dont les usagers et les services dépendants ont besoin.
Les estimations d’impact doivent elles aussi rester attachées à leur auteur et à leur moment de calcul. Le MIC a estimé qu’environ 23,16 millions de personnes avaient été touchées pour la voix et au moins 7,75 millions pour les données. La page consolidée publiée ensuite par KDDI indique environ 22,78 millions pour la voix et au moins 7,65 millions pour les données. Reuters, alors que l’enquête technique était encore en cours, évoquait une exposition potentielle pouvant atteindre 39,15 millions d’utilisateurs, dont 260 000 clients professionnels.
Additionner ou moyenner ces chiffres produirait une mesure qui n’existe dans aucun document. Les populations voix et données peuvent se recouper ; personnes, contrats, connexions et tentatives de service ne sont pas des unités interchangeables. Le maximum de 39,15 millions était une estimation précoce d’exposition potentielle, pas le décompte final des personnes effectivement touchées.
Une modification de routage omise a créé une panne partielle
La séquence technique débute pendant la maintenance d’un routeur du cœur de transport national au centre réseau de Tama. Selon la reconstitution du MIC, le travail a été mené avec une procédure erronée ou devenue obsolète. Celle-ci n’indiquait pas la modification de routage requise pour le trafic VoLTE, qui a continué à emprunter un chemin ne répondant plus comme prévu.
Le résultat n’était pas une coupure franche. Le MIC décrit une réponse défaillante environ une fois sur deux sur le chemin concerné. Cette intermittence a compté davantage que la durée de l’intervention initiale. Lorsqu’un composant ne reçoit plus aucune réponse, il peut déclarer une panne nette et basculer vers une solution connue. Lorsqu’une tentative sur deux aboutit, le même chemin peut paraître suffisamment vivant pour continuer à attirer du trafic.
La voix sur LTE exige l’enregistrement de localisation de l’abonné avant l’établissement normal des appels entrants et sortants. Quand l’accusé attendu ne revenait pas, terminaux et fonctions réseau considéraient l’enregistrement comme inachevé et recommençaient. Chaque nouvelle tentative était logique à l’échelle d’un appareil ; répétée par des millions de terminaux et par des fonctions distribuées, elle devenait une nouvelle source de charge.
La réponse manquante entraînait ainsi une nouvelle demande, qui consommait à son tour des ressources de contrôle d’appel et de base d’abonnés. La baisse de capacité provoquait davantage d’échecs, donc davantage de demandes. Le MIC estime que la charge des fonctions VoLTE de Tama a atteint environ sept fois le niveau normal et celle des autres sites VoLTE environ 6,5 fois le niveau normal. Ces multiplicateurs décrivent une charge technique, pas un pourcentage de clients touchés.
Le dossier ne présente pas l’événement comme une fuite BGP, un détournement de route, une cyberattaque, un incident DNS, une défaillance de spectre ou une simple panne matérielle. L’entrée initiale était une omission de routage VoLTE dans une procédure de maintenance ; la portée nationale et la durée s’expliquent ensuite par le comportement du système en fonctionnement.
VoLTE et état des abonnés ont formé une boucle de congestion
Les fonctions de contrôle d’appel ne travaillaient pas seules. L’enregistrement de localisation et la mise en place des sessions vocales dépendaient de bases d’abonnés chargées notamment de l’authentification, des politiques et de l’état de service. À mesure que les demandes VoLTE augmentaient, la sollicitation de ces bases augmentait aussi.
Le MIC décrit un cercle auto-entretenu. La congestion des bases d’abonnés produisait des réponses d’erreur ; ces erreurs poussaient les appareils et les fonctions réseau à réessayer ; les tentatives supplémentaires accentuaient la congestion. Le comportement de certains terminaux liait également l’échec de la session voix à leur état d’enregistrement, si bien que l’accès aux données pouvait devenir indisponible par intermittence alors même que la base consacrée aux données n’était pas le point de saturation initial.
Cette nuance est essentielle : les éléments disponibles ne montrent pas que toutes les données mobiles ont été continuellement indisponibles partout au Japon. Ils montrent une défaillance nationale des communications, avec des effets sur la voix, les SMS et, selon les appareils ou les restrictions de flux, sur les données. Deux utilisateurs pouvaient donc rencontrer des symptômes différents au même instant.
La forte charge a aussi dégradé la cohérence de l’état de contrôle. Des changements répétés de sessions d’authentification n’ont pas été correctement synchronisés à l’intérieur de certaines fonctions VoLTE. Six nœuds ont écrit leurs sauvegardes périodiques alors que cet état interne était incohérent. Lorsque les équipes les ont redémarrés en utilisant les dernières sauvegardes, ces six nœuds ont repris avec une partie du comportement anormal.
Un redémarrage n’était donc pas synonyme de reprise. L’équipement repartait, mais les données rechargées continuaient à provoquer des échecs d’authentification et des enregistrements répétés. Une autre divergence concernait les fonctions VoLTE, les bases d’abonnés et les passerelles de paquets PGW : certaines informations de session qui auraient dû être supprimées ne l’étaient pas lorsque la base était saturée, et les sessions suivantes pouvaient entrer en conflit avec l’état résiduel.
La leçon opérationnelle est précise. Une sauvegarde atteste qu’un état a été enregistré, non qu’il est sain. Une commande exécutée atteste qu’une action a eu lieu, non que le service est revenu à une situation cohérente. La reprise exige des mesures qui montrent ce que font réellement routes, sessions et fonctions de contrôle après l’intervention.
Le rétablissement a exigé une suite d’actions complémentaires
La réponse de KDDI a porté sur plusieurs parties de la boucle. Les équipes ont limité les demandes de connexion et le trafic VoLTE, redémarré des fonctions de contrôle d’appel, isolé certains PGW afin de réduire la charge imposée aux bases d’abonnés, réinitialisé des sessions PGW pour corriger des informations incompatibles et redistribué les flux vers les ressources de base d’abonnés.
Chaque mesure traitait un mécanisme différent. La limitation des flux ralentissait l’arrivée de nouvelles demandes. Les interventions sur les PGW modifiaient l’état présenté aux systèmes d’abonnés. La redistribution évitait qu’un chemin de base de données demeure le point de blocage. Les redémarrages tentaient d’éliminer le traitement anormal. Aucun de ces gestes ne suffit à résumer la reprise entière.
Les six nœuds de contrôle d’appel VoLTE restés dans un état anormal ont constitué une difficulté particulière. Le MIC indique qu’une tentative de blocage ne s’est pas achevée normalement, précisément parce que les nœuds étaient déjà perturbés. Ils ont continué à produire un volume excessif de signalisation après la réduction d’autres sources de charge. Leur isolement effectif a supprimé cette source persistante de nouvelles tentatives, puis la congestion a diminué.
Cette séquence explique pourquoi la fin des travaux ne garantit pas la fin du risque de service. Un opérateur peut avoir corrigé la configuration visée alors que le réseau en activité reste saturé. Les données peuvent redevenir largement disponibles tandis que les appels restent limités. Les taux de réussite peuvent retrouver un niveau normal alors qu’il faut encore vérifier des états cachés après une longue période de forte charge.
Le MIC a notamment critiqué la manière dont KDDI distinguait l’achèvement des travaux de rétablissement de la reprise complète du service. KDDI entendait encore retirer les limitations de flux et confirmer le retour à la normale ; une partie du public et des médias a compris que le service était déjà revenu. La congestion et certaines restrictions continuaient pourtant.
Il ne s’agissait pas seulement d’une difficulté de formulation. La langue révélait une insuffisance de mesure. Un bon modèle d’incident attribue un jalon distinct au retrait du défaut initial, à la maîtrise des nouvelles tentatives, à la résorption de la congestion, à la cohérence des sessions, à la levée des restrictions, à la stabilité de la voix et des données et à la vérification de bout en bout des services dépendants.
L’impact a dépassé les seuls téléphones
KDDI mentionne des perturbations touchant les mises à jour de livraison et les communications avec les chauffeurs, les véhicules connectés, la collecte de données météorologiques, les compteurs d’eau, certains distributeurs bancaires, des communications sans fil dans les aéroports et des systèmes de paiement dans les bus. Reuters a, de manière indépendante, décrit des effets sur la météo, la livraison de colis, la banque et les véhicules connectés.
Ces exemples montrent qu’une connexion mobile peut être un chemin de commande ou de remontée d’information à l’intérieur d’un autre service. Pour un particulier, la panne visible est l’impossibilité de passer un appel. Pour un logisticien, elle peut prendre la forme de statuts absents. Pour une collectivité, ce sont des observations qui n’arrivent plus. Pour un service de transport ou bancaire, c’est un terminal distant qui ne termine pas une transaction courante.
La portée de ces exemples doit rester bornée. Ils n’établissent pas que chaque service cité a été interrompu dans tout le pays pendant les 61 heures et 25 minutes. Ils démontrent l’étendue des dépendances, non une chronologie universelle pour chacune d’elles.
L’enjeu le plus sensible concerne les appels d’urgence. Reuters a rapporté l’inquiétude du ministre des Communications face aux entraves touchant les appels d’incendie et de secours destinés à protéger les personnes et les biens. Kyodo a ensuite indiqué que certains usagers n’avaient pas pu composer le 110 ou le 119 pendant une période prolongée.
Les éléments publics ne donnent toutefois aucun nombre d’appels d’urgence échoués, d’urgences distinctes, de blessés ou de décès. Ils ne permettent pas non plus de chiffrer une perte économique globale. Il serait incorrect de combler ces absences par une estimation. Le constat étayé est déjà grave : l’accès à des numéros d’urgence a été entravé au cours d’une longue perturbation nationale.
Le constat réglementaire n’est pas une décision judiciaire
Le MIC a traité la panne comme un accident grave et conduit une vérification technique spécifique. Ses conclusions ne réduisent pas l’événement à une seule erreur humaine. Elles relèvent des faiblesses dans la sélection et l’approbation des procédures, la vérification de la normalité du service, l’évaluation des risques, la conception des protections contre la congestion, l’étude d’une propagation nationale, les essais de redémarrage sous forte charge, la complexité de la reprise, les exercices d’incident et l’information des clients.
Ce constat à plusieurs niveaux compte pour la responsabilité. Une mauvaise instruction peut déclencher un incident, mais la résilience nationale dépend de mécanismes conçus en supposant que procédures et opérateurs peuvent parfois se tromper. Il faut reconnaître les réponses partielles, borner les répétitions, prévoir des zones de confinement, éprouver sauvegardes et redémarrages sous charge anormale et exercer la sortie des états que l’automatisation ordinaire ne sait pas résoudre.
KDDI a annoncé un renforcement du choix et de l’approbation des procédures, une meilleure détection de la congestion, une révision des mécanismes de limitation, de nouvelles méthodes et de nouveaux outils de reprise, ainsi qu’une information améliorée des clients. Ces mesures répondent aux chemins de défaillance documentés. Le dossier public ne contient cependant pas de test actuel, indépendant et couvrant l’ensemble du parc qui démontrerait leur efficacité en 2026.
L’entreprise a également organisé des compensations. Sa page distingue les remboursements prévus par les conditions de service pour les clients privés de toutes communications pendant plus de 24 heures consécutives, ou dans une situation équivalente, d’un remboursement d’excuse de 200 yens destiné à un groupe beaucoup plus large. Kyodo a évoqué un coût attendu d’environ 7,3 milliards de yens et une réduction volontaire de la rémunération du président de KDDI.
Ce sont des réponses commerciales et de gouvernance de l’opérateur. Elles ne constituent ni une amende pécuniaire imposée par le régulateur, ni une condamnation pénale, ni une décision judiciaire établissant une responsabilité. Les documents permettent d’affirmer la qualification d’accident grave, les constats techniques du MIC, les mesures déclarées et le programme de compensation — rien de plus sur le terrain juridique.
La continuité se démontre dans le service en fonctionnement
L’incident fait apparaître trois niveaux de preuve. Le premier est l’état voulu : procédure approuvée, route attendue, protections configurées, stratégie de reprise et politique d’information. Ces éléments sont nécessaires, mais ils ne suffisent pas à établir la continuité.
Le deuxième est l’état technique observé. Il faut savoir quel chemin emprunte réellement la signalisation VoLTE, si les réponses reviennent, où se concentrent les nouvelles tentatives, quels nœuds sont synchronisés, si l’état des abonnés concorde avec celui des PGW et si un redémarrage a chargé une sauvegarde saine. Ces observations décrivent le réseau présent, pas le réseau prévu.
Le troisième est le résultat de service. Un équipement déclaré sain ne prouve pas qu’un usager peut s’enregistrer, appeler, recevoir un appel, envoyer un message, utiliser les données ou joindre un centre d’urgence. La reprise doit s’appuyer sur des essais de bout en bout couvrant des appareils, régions, usages et organisations dépendantes représentatifs. Le jalon public doit venir après ces résultats.
Le rapport réglementaire conserve la mémoire vérifiable de l’incident : termes, chiffres, chronologie et attentes correctives. Il ne transporte toutefois aucun appel, n’arrête aucune répétition et ne rapproche aucune session. Sa valeur opérationnelle tient aux épreuves qu’il impose au réseau vivant.
La vraie question après 2022 n’est donc pas seulement de savoir si la route initiale a été corrigée. Elle est de déterminer si les contrôles actuels peuvent prouver qu’une défaillance intermittente semblable reste locale, que la demande répétée demeure bornée, que les données de reprise restent fiables, que les équipes gardent de la visibilité et que les mots employés en public correspondent aux résultats constatés chez les usagers.
Ce que les informations publiques ne permettent pas d’établir
Le rapport du MIC offre une reconstitution détaillée, mais les documents publics ne donnent pas tous les journaux internes, chaque commande de reprise, l’identité de chaque décideur ni le résultat pour chaque appareil. Ils ne quantifient ni les échecs d’appels d’urgence, ni les dommages corporels, ni la perte économique.
Les estimations officielles ont changé selon les dates de publication. Cela ne les rend pas inutiles ; cela impose de conserver leur attribution et leur méthode. De même, une liste de mesures annoncées en 2022 ne démontre pas leur efficacité actuelle. Un outil peut être déployé sans couvrir tous les nœuds concernés ; une procédure peut être modifiée sans avoir été testée sous perte intermittente et charge nationale ; un exercice peut réussir sans reproduire un état d’abonnés incohérent.
Ces limites renforcent la conclusion responsable. L’incident a commencé par une erreur concrète de maintenance et de routage, s’est propagé par des mécanismes observables de répétition et de congestion, a persisté au travers d’états incohérents, a touché des dépendances critiques et a exigé une reprise en plusieurs étapes. La responsabilité doit donc porter sur les contrôles et les résultats démontrables, sans inventer de dommage ni de faute individuelle.
Sources
- KDDI, présentation de la défaillance de communication du 2 juillet et de la réponse apportée
- Conseil de vérification des accidents de télécommunications du MIC japonais, rapport sur l’accident grave de KDDI et Okinawa Cellular du 2 juillet 2022
- Reuters via Euronews, KDDI cherche à rétablir le service après une panne touchant potentiellement 40 millions d’utilisateurs
- Kyodo News, indemnisation annoncée pour les personnes touchées par la panne de KDDI
Briefing des membres
Contexte approfondi du profil
Connectez-vous avec le bon niveau d'adhésion pour débloquer le briefing complet et les notes de source.
Réservé à Strategic Circle
Strategic Circle
Ouvert à tous les lecteurs. Débloquez les briefings de profil après adhésion et connexion.
Rejoindre Strategic CircleRéservé aux membres de Leadership Alliance
Leadership Alliance
Réservé aux propriétaires et dirigeants qualifiés d'actifs IP ; connectez-vous pour débloquer les briefings Alliance.
Rejoindre Leadership Alliance
