• NICT teilte mit, dass ein Teil seines redundant ausgelegten öffentlichen Zeitdienstsystems während Wartungsarbeiten 11 Minuten lang fehlerhafte Zeitstempel verteilte
  • Als NICT den Vorfall bekannt gab, lief der Dienst normal; Ursache und Ausmaß der Zeitabweichung wurden weiterhin untersucht

Der Sachverhalt

Das japanische National Institute of Information and Communications Technology teilte am 11. September mit, dass ein Teil seines öffentlichen Internet-Zeitdienstes bei Wartungsarbeiten zwei Tage zuvor fehlerhafte Zeitstempel verteilt hatte. Der Vorfall dauerte von 10:20 bis 10:31 Uhr japanischer Standardzeit. NICT zufolge war ein Teil seines redundanten Systems betroffen. Bei Veröffentlichung der Mitteilung lief der Dienst normal, und seine übrigen Zeitverteilungsdienste waren nicht betroffen. Ingenieure untersuchten weiterhin die genaue Ursache.

Vor den Wartungsarbeiten hatte NICT gewarnt, dass Verbindungen zu einigen Servern am 9. September zwischen 10:00 und 12:00 Uhr unterbrochen werden könnten, während andere Server den Dienst voraussichtlich verfügbar halten würden. Die spätere Mitteilung benannte ein anderes Problem: Ein Teil des Systems hatte fehlerhafte Zeitangaben geliefert, statt lediglich nicht verfügbar zu sein. Der öffentliche Zeitdienst nutzt das Network Time Protocol, kurz NTP, um Zeitangaben über das Internet zu verteilen. NICT legte nicht offen, wie stark die Zeitstempel abwichen, wie viele Nutzer sie erhielten oder ob angeschlossene Systeme ihre Uhren anpassten.

Die Einschätzung

Die Mitteilung von NICT ist problematischer als eine einfache Ausfallmeldung, weil der Dienst nicht einfach unerreichbar war. Einige Server antworteten weiter, jedoch mit einer falschen Zeitangabe. Eine gewöhnliche Verfügbarkeitsprüfung hätte daher weiterhin einen grünen Status anzeigen können, während Clients fehlerhafte Daten erhielten.

Entscheidend ist nun, ob Kundensysteme diesen Antworten tatsächlich vertrauten. Ein Client, der mehrere tatsächlich unabhängige Zeitquellen nutzte, könnte den fehlerhaften Wert verworfen haben, wenn andere Quellen davon abwichen. Ein System, das sich zu stark auf eine Quelle stützte, könnte sich anders verhalten haben. Das 11-minütige Zeitfenster bietet Infrastrukturteams einen klaren Ansatzpunkt: NTP-Clientprotokolle, Aufzeichnungen zum Zeitversatz und Überwachungsalarme sollten zeigen, ob ein betroffener Server ausgewählt wurde und ob sich die lokale Systemzeit veränderte.

Für die Leserschaft von BTW ist dies eine Erinnerung daran, dass Resilienz nicht nur bedeutet, einen Dienst online zu halten. Bei Infrastruktur zur Zeitsynchronisation muss der Dienst zudem korrekte Zeit liefern. NICT hat keine weitverbreiteten Folgeausfälle gemeldet. Der nächste Schritt besteht daher darin festzustellen, welche Systeme die fehlerhaften Zeitstempel erhielten, welche sie akzeptierten und ob die Überwachung das Problem erkannte, bevor es Anwendungen beeinträchtigte.

Worauf zu achten ist

Zu beobachten ist, ob NICT die Ursache und das Ausmaß der Zeitabweichung offenlegt und erklärt, wie das Problem erkannt wurde. Eine konkrete Präventionsmaßnahme würde zeigen, was nach dem Vorfall geändert wurde, und Nutzern helfen, ihre eigenen Aufzeichnungen aus dem betroffenen Zeitraum einzuordnen.