Zusammenfassung
- Der Vorfall begann am 2. Juli 2022 gegen 01:35 Uhr japanischer Zeit während Wartungsarbeiten an einem landesweit eingesetzten Transport-Core-Router in KDDIs Netzstandort Tama. Eine falsche oder veraltete Arbeitsanweisung ließ die erforderliche VoLTE-Routingänderung aus; intermittierende Antwortfehler lösten daraufhin wiederholte Standortregistrierungen aus.
- Die Wiederholungslast breitete sich über verteilte VoLTE-Steuerfunktionen und Teilnehmerdatenbanken aus. Das japanische Ministerium für Inneres und Kommunikation schätzte in Tama etwa das Siebenfache, an anderen VoLTE-Standorten ungefähr das 6,5-Fache der normalen Last. Sechs Steuerknoten starteten später aus Sicherungen, die während eines inkonsistenten internen Zustands geschrieben worden waren.
- Die Rücknahme des Routingfehlers genügte nicht. KDDI setzte Verkehrsbegrenzungen, Neustarts von Anrufsteuerungsfunktionen, die Isolierung von PGW-Einheiten und Sitzungsrücksetzungen, eine Umverteilung der Datenbanklast sowie schließlich die Abtrennung von sechs dauerhaft auffälligen VoLTE-Knoten ein.
- Das amtliche Zeitfenster der Dienstbeeinträchtigung betrug 61 Stunden und 25 Minuten: von 01:35 Uhr am 2. Juli bis 15:00 Uhr am 4. Juli. Den vollständigen Normalbetrieb aller Telekommunikationsnetze bestätigte KDDI erst am 5. Juli um 15:36 Uhr, rund 86 Stunden nach Beginn. Beide Angaben messen unterschiedliche Betriebszustände.
- Das Ministerium behandelte das Ereignis als schweren Unfall und benannte Mängel bei Verfahrenskontrolle, Risikoanalyse, Überlastungsdesign, Wiederherstellungstests unter hoher Last, Übungen und Kundeninformation. KDDIs Erstattungen und angekündigte Gegenmaßnahmen waren Reaktionen des Betreibers, keine behördlich verhängte Geldbuße und kein Gerichtsurteil.
Ein Vorfall, zwei betriebliche Zeitachsen
KDDI datiert den Beginn der Kommunikationsstörung auf etwa 01:35 Uhr am Samstag, dem 2. Juli 2022. Die zusammenfassende englische Ereignisseite des Unternehmens nennt als Ende der beeinträchtigten Dienstzeit 15:00 Uhr am Montag, dem 4. Juli. Daraus ergeben sich 61 Stunden und 25 Minuten. Das Ministerium für Inneres und Kommunikation, im Folgenden MIC, verwendete in seinem technischen Verifikationsbericht dasselbe Zeitfenster.
Kyodo berichtete über einen späteren Meilenstein. Erst am Dienstag, dem 5. Juli, bestätigte KDDI um 15:36 Uhr, dass sämtliche Telekommunikationsnetze vollständig normal arbeiteten. Seit dem Beginn waren zu diesem Zeitpunkt rund 86 Stunden vergangen. Die längere Frist ersetzt nicht die amtliche Beeinträchtigungsdauer; die kürzere Frist macht die zusätzliche Stabilisierung und Prüfung ebenfalls nicht überflüssig.
Die erste Uhr beschreibt den Zeitraum, den Betreiber und Aufsicht als Dienstbeeinträchtigung auswiesen. Die zweite endet mit der Bestätigung des Normalbetriebs im gesamten Netz. Dazwischen lagen das Zurücknehmen von Durchflussbeschränkungen, Stabilitätsbeobachtung, die Prüfung erfolgreicher Sprachverbindungen, die Bereinigung widersprüchlicher Zustände und die Entscheidung, dass das System wieder gewöhnliche Nachfrage tragen konnte. Werden alle diese Schritte pauschal „Wiederherstellung“ genannt, fehlt die Grundlage für eine belastbare Bewertung.
Auch die Wirkungszahlen gehören zu bestimmten Erhebungsständen. Das MIC schätzte etwa 23,16 Millionen vom Sprachdienst betroffene Menschen und mindestens 7,75 Millionen vom Datendienst betroffene Menschen. KDDIs spätere Übersichtsseite nennt rund 22,78 Millionen für Sprache und mindestens 7,65 Millionen für Daten. Reuters berichtete in einer frühen Untersuchungsphase von einer möglichen Exposition von bis zu 39,15 Millionen Nutzern, darunter 260.000 Geschäftskunden.
Diese Werte dürfen weder gemittelt noch addiert werden. Die frühe Höchstzahl bezeichnete eine mögliche Reichweite, als der detaillierte Ablauf noch untersucht wurde. MIC und KDDI veröffentlichten ihre Angaben zu unterschiedlichen Zeitpunkten und mit eigenen Berechnungen. Sprach- und Datengruppen können sich überschneiden; Verträge, Anschlüsse, Menschen und einzelne Dienstversuche sind keine austauschbaren Einheiten. Präzision bedeutet hier, jede Zahl bei ihrem Urheber und ihrer Definition zu belassen.
Eine ausgelassene Routingänderung erzeugte einen gefährlichen Teilfehler
Die technische Kette begann bei der Wartung eines landesweiten Transport-Core-Routers am Netzstandort Tama. Nach der Rekonstruktion des MIC wurde eine falsche oder veraltete Arbeitsanweisung verwendet. Darin fehlte die nötige Routingänderung für VoLTE-Verkehr, sodass Signalisierung auf einen Pfad verwiesen blieb, der nicht mehr wie vorgesehen antwortete.
Der Fehler war kein sauberer Totalausfall. Das MIC beschrieb eine Lage, in der Antworten ungefähr in jedem zweiten Fall ausblieben. Gerade diese Unvollständigkeit war folgenreich. Bei einem eindeutigen Ausfall kann eine Funktion den Pfad verwerfen und eine bekannte Alternative wählen. Wenn Anfragen gelegentlich Erfolg haben, bleibt der kranke Pfad plausibel genug für weitere Versuche.
Mobiltelefonie über LTE benötigt eine Standortregistrierung. Das Endgerät muss als berechtigter Teilnehmer erkannt und für eingehende wie ausgehende Sprachverbindungen erreichbar eingetragen werden. Blieb die Bestätigung aus, galt die Registrierung als unvollständig und wurde erneut angestoßen.
Für ein einzelnes Gerät ist eine Wiederholung vernünftig. Gefährlich wird sie, wenn Millionen Endgeräte und verteilte Steuerfunktionen dieselbe Entscheidung treffen. Jede verlorene Antwort erzeugte zusätzliche Arbeit. Diese Arbeit belegte Kapazität in der Anrufsteuerung und in Teilnehmerdatenbanken, woraufhin weitere Antworten scheiterten und weitere Wiederholungen folgten.
Das MIC schätzte die Belastung der VoLTE-Steuerfunktionen in Tama auf ungefähr das Siebenfache des Normalwerts. An anderen VoLTE-Standorten lag sie bei etwa dem 6,5-Fachen. Die verteilte Architektur machte aus einem örtlichen Wartungsfehler ein landesweit gekoppeltes Steuerungsproblem.
Hier liegt die erste Verantwortungsgrenze. Die ausgelassene Änderung erklärt, warum der ungewöhnliche Verkehr begann. Sie erklärt nicht allein, warum er sich national ausbreitete und tagelang wirkte. Dafür sind die laufende Topologie, die Wiederholungslogik und der Schutz vor Überlastung zu untersuchen. Der belegte Ablauf war weder ein BGP-Leak noch eine Routenübernahme, kein Cyberangriff, kein DNS-Vorfall, kein Spektrumausfall und auch nicht bloß der Defekt eines Bauteils.
VoLTE-Steuerung und Teilnehmerzustand verstärkten die Überlastung
Die VoLTE-Knoten waren auf Teilnehmerdatenbanken für Authentisierung, Richtlinien, Abrechnung und Standort- oder Dienstzustand angewiesen. Mit jeder zusätzlichen Registrierung stieg daher nicht nur die Last in der Anrufsteuerung, sondern auch die Zahl der Datenbankanfragen.
Das MIC beschrieb eine Rückkopplung. Überlastete Teilnehmerdatenbanken gaben Fehler zurück. Diese Fehler veranlassten Geräte und Netzfunktionen zu weiteren Anfragen. Die zusätzlichen Anfragen erhöhten wiederum die Überlastung. Bei manchen Geräten beeinflusste ein fehlgeschlagener Aufbau der Sprachsitzung außerdem den registrierten Zustand, sodass zeitweise auch Datendienste nicht verfügbar waren, obwohl die für Daten zuständige Datenbank nicht der ursprüngliche Engpass war.
Daraus folgt keine durchgehend vollständige Abschaltung sämtlicher Mobilfunkdaten in ganz Japan. Belegt ist eine landesweite Kommunikationsstörung mit Auswirkungen auf Sprache, SMS und – abhängig von Gerät, Registrierungszustand und Verkehrsbegrenzung – Daten. Nutzer und Dienste konnten zur selben Zeit unterschiedliche Symptome sehen.
Die Unterscheidung ist auch für die Diagnose wichtig. Ein Datenpfad kann technisch erreichbar sein, während ein Gerät wegen unvollständiger Registrierung nicht auf ihn zugreifen kann. Ein Knoten kann einen lokalen Gesundheitstest bestehen und zugleich durch seine Fehler eine Registrierungswelle in anderen Systemen verstärken. Einzelne grüne Anzeigen ergeben daher noch kein belastbares Bild des Gesamtdienstes.
Eine Sicherung kann den Fehler konservieren
Unter der hohen Last geriet der Steuerzustand auseinander. Das MIC stellte fest, dass häufige Änderungen von Authentisierungssitzungen in einigen VoLTE-Steuerknoten nicht korrekt synchronisiert wurden. Sechs Knoten schrieben regelmäßige Sicherungen, während ihr interner Zustand inkonsistent war. Nach Neustarts aus den jeweils neuesten Sicherungen kehrten diese sechs Knoten mit dem auffälligen Verhalten zurück.
Ein erfolgreicher Neustart war damit keine erfolgreiche Wiederherstellung. Das Gerät lief, doch der geladene Zustand verursachte weiterhin Authentisierungsfehler und Registrierungswiederholungen. Eine Sicherungsdatei dokumentiert einen Zeitpunkt; sie beweist nicht, dass der gespeicherte Zustand sauber war. Dafür muss bekannt sein, ob die Systeme synchron waren, ob Teilnehmer- und PGW-Sitzungen übereinstimmten und ob ein begrenzter Wiederanlauf die Fehlerrate tatsächlich senkte.
Zusätzlich entstand eine Inkonsistenz zwischen VoLTE-Funktionen, Teilnehmerdatenbanken und PGW-Einheiten. Sitzungsinformationen, die bei hoher Datenbanklast hätten gelöscht werden sollen, blieben teilweise bestehen. Spätere Sitzungen trafen dadurch auf alten Zustand. Die Bereinigung musste sorgfältig erfolgen, weil die beteiligten Systeme bereits unter Kapazitätsdruck standen.
Der Vorfall zeigt damit den Vorrang des beobachtbaren Betriebs. Ein Neustartverfahren kann genehmigt, der Befehl korrekt ausgeführt und der logische Zustand dennoch falsch sein. Entscheidend ist die Wirkung: sinkende Registrierungswiederholungen, übereinstimmende Sitzungen, synchronisierte Steuerknoten und erfolgreiche End-to-End-Dienste. Nur diese Ergebnisse belegen, dass die Wiederherstellung einen sauberen Zustand erreicht hat.
Verkehrsbegrenzung war nötig, aber nicht hinreichend
KDDIs Reaktion bestand aus mehreren Eingriffsarten. Das MIC nennt Begrenzungen für Verbindungsanforderungen und VoLTE-Verkehr, Neustarts der Anrufsteuerung, die Isolierung einzelner PGW-Einheiten zur Entlastung der Teilnehmerdatenbanken, Rücksetzungen von PGW-Sitzungen, um widersprüchliche Sitzungsinformationen zu korrigieren, und eine Umverteilung des PGW-Verkehrs auf andere Datenbankressourcen.
Jede Maßnahme adressierte einen anderen Teil der Schleife. Durchflussbegrenzungen reduzierten neue Nachfrage. PGW-Isolierung und Sitzungsrücksetzungen änderten den Zustand, den die Teilnehmerfunktionen sahen. Die Umverteilung sollte verhindern, dass ein Datenbankpfad dauerhaft begrenzte. Neustarts sollten die fehlerhafte Verarbeitung entfernen. Keine einzelne Handlung steht für die gesamte Wiederherstellung.
Besonders hartnäckig waren die sechs VoLTE-Steuerknoten mit auffälligem Zustand. Ein Versuch, sie zu blockieren, lief nach der MIC-Rekonstruktion nicht normal ab, weil die Knoten bereits gestört waren. Sie erzeugten weiterhin übermäßige Signalisierung, nachdem andere Lastquellen schon reduziert worden waren. Erst ihre Isolierung entfernte die fortbestehende Wiederholungsquelle; anschließend ging die Überlastung zurück.
Diese Abfolge offenbart die Schwäche pauschaler Statuswörter. Ein Wartungsteam kann die geplante Reparatur beendet haben, während das laufende Netz noch überlastet ist. Die meisten Datenpfade können funktionieren, obwohl Sprache weiter begrenzt bleibt. Die Anruferfolgsrate kann normal erscheinen, obwohl nach langem Hochlastbetrieb noch verborgene Zustände geprüft werden müssen.
Das MIC kritisierte später die öffentliche Unterscheidung zwischen abgeschlossenem Wiederherstellungsaufwand und vollständig wiederaufgenommenem Dienst. KDDI wollte nach Abschluss der Arbeiten zunächst Verkehrsbegrenzungen entfernen und den Normalzustand prüfen. Teile der Öffentlichkeit verstanden die Meldung jedoch als unmittelbare Rückkehr des Dienstes, obwohl Überlastung und Beschränkungen fortbestanden.
Das war nicht nur ein Formulierungsproblem. Es zeigte, dass technische Zustände und öffentliche Meilensteine nicht sauber verknüpft waren. Ein robustes Lagebild trennt daher: Auslöser entfernt, Wiederholungswachstum begrenzt, auffällige Knoten isoliert, Sitzungen abgeglichen, Verkehrsbegrenzungen zurückgenommen, Sprach- und Datenerfolg stabil, abhängige Dienste geprüft und Beobachtung beendet.
Die Folgen reichten weit über Mobiltelefone hinaus
KDDIs Darstellung nennt beeinträchtigte Lieferaktualisierungen und Fahrerkommunikation, vernetzte Fahrzeuge, Wetterdatenerfassung, Wasserzähler, Bankautomaten, drahtlose Flughafenkommunikation und Bezahlsysteme in Bussen. Reuters berichtete unabhängig über Störungen bei Wetterdaten, Paketlieferung, Bankdiensten und vernetzten Fahrzeugen.
Diese Beispiele belegen nicht, dass jeder genannte Dienst im ganzen Land während des gesamten Vorfalls ausfiel. Sie zeigen die Reichweite von Abhängigkeiten. Eine Mobilfunkverbindung kann Steuer- oder Meldeweg eines anderen Dienstes sein. Derselbe Ausfall erscheint beim Privatkunden als fehlgeschlagener Anruf, beim Logistiker als fehlendes Statussignal und bei einer öffentlichen Stelle als ausbleibende Messung.
Die größte Kontinuitätsfolge betrifft Notrufe. Reuters gab die Sorge des Kommunikationsministers wieder, dass Feuerwehr- und Notrufe zum Schutz von Leben und Eigentum behindert worden seien. Kyodo berichtete, manche Nutzer hätten über längere Zeit weder 110 noch 119 wählen können. Die vorliegenden Unterlagen nennen keine Zahl gescheiterter Notrufversuche oder unterschiedlicher Notfälle und belegen weder Verletzungen noch Todesfälle oder einen bestimmten wirtschaftlichen Schaden.
Diese Lücke darf nicht mit Vermutungen gefüllt werden. Der belastbare Befund ist bereits ernst: Während einer langen landesweiten Mobilfunkstörung war der Zugang zu Notrufnummern beeinträchtigt. Für die Betriebsverantwortung folgt daraus die Frage, ob ein überlebensfähiger Kommunikationsweg vorhanden ist, wenn Sprachregistrierung, Teilnehmerauthentisierung oder normale Verkehrssteuerung versagen.
Der Aufsichtsbericht benennt Kontrollmängel, nicht jede Rechtsfolge
Das MIC behandelte die Störung als schweren Unfall und setzte eine technische Verifikation auf. Der Befund wurde nicht auf einen einzelnen menschlichen Fehler reduziert. Genannt wurden Schwächen bei Auswahl und Freigabe von Arbeitsanweisungen, Prüfungen des Dienstzustands, Risikoanalyse, Überlastungssteuerung, Bewertung landesweiter Ausbreitung, Neustarttests unter hoher Last, komplexen Wiederherstellungsabläufen, Übungen und Kundenkommunikation.
Der mehrschichtige Befund ist wichtig. Ein falsches Verfahren kann den Vorfall auslösen; nationale Widerstandsfähigkeit entsteht aber durch Kontrollen, die Fehler in Verfahren und Entscheidungen einkalkulieren. Teilantworten müssen erkannt, Wiederholungen begrenzt, verteilte Systeme in Zonen eingegrenzt und Neustarts sowie Sicherungen unter realistischen Hochlastbedingungen geprüft werden.
KDDI berichtete über stärkere Freigabekontrollen, bessere Überlastungserkennung, eine Überarbeitung der Überlastungssteuerung, angepasste Wiederherstellungsabläufe und Werkzeuge sowie verbesserte Kundeninformation. Diese Maßnahmen passen zu den dokumentierten Fehlerwegen. Die öffentliche Darstellung ihrer Umsetzung ist jedoch kein aktueller, unabhängiger Nachweis, dass sie 2026 über die gesamte technische Flotte wirksam sind.
Das Unternehmen kündigte außerdem Entschädigungen an. KDDI unterschied vertragsbezogene Erstattungen für Kunden, die länger als 24 Stunden ohne sämtliche Kommunikationsdienste oder in einer gleichwertigen Lage waren, von einer Entschuldigungsgutschrift über 200 Yen für eine deutlich größere Kundengruppe. Kyodo bezifferte die erwarteten Kosten auf etwa 7,3 Milliarden Yen und berichtete über eine freiwillige Gehaltskürzung des KDDI-Präsidenten.
Dabei handelt es sich um Reaktionen des Betreibers in Kundenbeziehung und Unternehmensführung. Sie sind weder eine vom MIC verhängte Geldbuße noch eine strafrechtliche Entscheidung oder ein gerichtlicher Haftungsspruch. Belegt sind die Einstufung als schwerer Unfall, die Verifikationsergebnisse, gemeldete Abhilfen und das Entschädigungsprogramm. Weitergehende Rechtsfolgen dürfen daraus nicht erfunden werden.
Kontinuitätsnachweise müssen den laufenden Dienst beschreiben
Der Vorfall legt eine praktische Hierarchie nahe. Auf der ersten Stufe steht der Sollzustand: freigegebene Arbeitsanweisung, erwarteter Pfad, konfigurierte Überlastungskontrollen, Wiederherstellungsplan und Kommunikationsregeln. Diese Aufzeichnungen sind wichtig, können aber allein keine Kontinuität beweisen.
Die zweite Stufe ist der beobachtete technische Zustand. Ein Betreiber muss sehen, welchen Pfad VoLTE-Signalisierung tatsächlich nimmt, ob Bestätigungen zurückkehren, wie sich Wiederholungen verteilen, welche Steuerknoten synchron sind, ob Teilnehmer- und PGW-Sitzungen übereinstimmen und ob ein Neustart eine saubere Sicherung geladen hat. Diese Messwerte beschreiben das Verhalten des Netzes statt die Absicht seiner Dokumente.
Die höchste Stufe ist der vollständige Dienst. Ein erfolgreicher Knotentest beweist nicht, dass Nutzer sich registrieren, Anrufe tätigen und empfangen, Nachrichten senden, Daten nutzen oder eine Notrufzentrale erreichen können. Notwendig sind End-to-End-Prüfungen mit repräsentativen Geräten, Regionen, Diensten und abhängigen Organisationen. Der öffentliche Meilenstein sollte diesen Ergebnissen folgen.
Aufsichtsberichte bewahren ein wichtiges Protokoll von Begriffen, Zahlen, Chronologie und Korrekturerwartungen. Sie können jedoch keinen Verkehr tragen, keine Wiederholung stoppen, keine Sitzung abgleichen und keinen Notruf zustellen. Ihr betrieblicher Wert liegt darin, überprüfbare Anforderungen für das laufende Netz zu schaffen.
Die entscheidende Frage nach KDDIs Ausfall lautet deshalb nicht nur, ob die ursprüngliche Route korrigiert wurde. Sie lautet, ob heutige Kontrollen nachweisen können, dass ein ähnlicher Teilfehler lokal bleibt, Wiederholungslast begrenzt wird, Wiederherstellungsdaten vertrauenswürdig sind, der Betrieb Sicht behält und öffentliche Zustandsangaben den wirklichen Kundenergebnissen entsprechen.
Was die öffentlichen Unterlagen nicht belegen
Der MIC-Bericht rekonstruiert viele Details, veröffentlicht aber weder sämtliche internen Protokolle noch jeden Wiederherstellungsbefehl oder die Verantwortung für jede Einzelentscheidung. Er liefert keine vollständige Geräteerhebung. Die Quellen beziffern weder fehlgeschlagene Notrufversuche noch Verletzungen, Todesfälle oder einen bestimmten wirtschaftlichen Verlust.
Auch die Wirkungsschätzungen änderten sich zwischen den Erhebungsständen. Das macht sie nicht wertlos, verlangt aber klare Zuordnung. Die 39,15 Millionen bleiben eine früh gemeldete mögliche Exposition. Die 23,16 Millionen für Sprache und mindestens 7,75 Millionen für Daten gehören zur MIC-Schätzung. Die späteren 22,78 Millionen beziehungsweise mindestens 7,65 Millionen gehören zu KDDIs Übersichtsseite.
Ebenso lässt sich heutige Wirksamkeit nicht aus einer 2022 angekündigten Maßnahmenliste ableiten. Ein neues Werkzeug kann nur einen Teil der Knoten abdecken. Ein geändertes Verfahren kann ohne realistischen Test gegen Teilantworten und nationale Wiederholungslast bleiben. Eine Übung kann im Labor gelingen, ohne widersprüchliche Teilnehmerzustände nachzubilden. Erforderlich ist wiederkehrender Betriebsnachweis.
Diese Grenzen schwächen die Verantwortungsanalyse nicht. Sie halten sie an überprüfbaren Tatsachen fest. Der Ausfall begann mit einem konkreten Wartungs- und Routingfehler, breitete sich über beobachtbare Wiederholungs- und Überlastungsmechanismen aus, überdauerte Neustarts in inkonsistentem Zustand, traf kritische Abhängigkeiten und erforderte eine mehrstufige Wiederherstellung. Die Schlussfolgerung betrifft Kontrollen und Evidenz, nicht erfundene Schäden oder persönliche Schuld.
Quellen
- KDDI, The July 2 Communication Failure and Our Response
- Japanisches MIC, technischer Verifikationsbericht zum schweren Unfall bei KDDI und Okinawa Cellular
- Reuters über Euronews, KDDI strebt Wiederherstellung nach weitreichender Störung an
- Kyodo News, KDDI kündigt Entschädigungen für Betroffene des Netzausfalls an
Mitgliederbriefing
Detaillierter Profilkontext
Melden Sie sich mit der richtigen Mitgliedschaftsstufe an, um das vollständige Briefing und die Quellennotizen freizuschalten.
Nur für Strategic Circle
Strategic Circle
Offen für alle Leser. Schalten Sie Profil-Briefings nach Beitritt und Anmeldung frei.
Strategic Circle beitretenNur für Leadership Alliance
Leadership Alliance
Für qualifizierte Inhaber von IP-Assets und Management; melden Sie sich an, um Leadership-Alliance-Briefings freizuschalten.
Leadership Alliance beitreten
