Zusammenfassung

  • RFC 3386 beschrieb den Wettlauf mehrerer Wiederherstellungsinstanzen: SDH/SONET konnte denselben physischen Fehler umschalten, den MPLS oder IP bereits umgehen wollte.
  • Eine Haltezeit gab der unteren Schicht ein befristetes Erstzugriffsrecht. Sie war Koordination, aber kein Nachweis für erfolgreiche Umschaltung, physische Diversität oder Anwendungsfortsetzung.

Fällt das Licht auf einer Faser aus, erkennt die Optik einen physikalischen Fehler. SDH/SONET sieht eine unterbrochene Verbindung, MPLS einen nicht mehr tragenden LSP und IP verlorene Erreichbarkeit. Alle Beobachtungen können richtig sein. Daraus folgt noch nicht, dass alle vier Schichten zugleich handeln sollten.

RFC 3386 erschien im November 2002 als Informational. Ein Designteam der IETF Traffic Engineering Working Group sammelte kurzfristige Anforderungen von Netzbetreibern an Überlebensfähigkeit und Hierarchie. Das Dokument standardisierte kein vollständiges Wiederherstellungsprotokoll und berichtete keine gemessene Einführung. Es wollte wenige interoperable Ansätze für Paket- und Transportnetze herausarbeiten.

Vertikale Hierarchie bezeichnete die Grenze zwischen Technologien; horizontale Hierarchie die Aufteilung innerhalb einer Technologie in Gebiete oder Verwaltungsdomänen. Gerade vertikal konnte jede Schicht einen eigenen Schutz besitzen, während ihre internen Vorgänge für die anderen Schichten unsichtbar blieben.

Reagierten alle sofort, schaltete die Transportschicht womöglich gerade auf Ersatz, während MPLS den Verkehr bereits neu führte. Derselbe Dienst wechselte zweimal, zwei Controller beanspruchten Reservekapazität, und die obere Berechnung arbeitete mit einer Topologie, die sich unter ihr veränderte. Lokale Geschwindigkeit erzeugte globale Unruhe.

Als pragmatische Koordination schlug RFC 3386 verschachtelte Zeiten vor. Brauchte die untere Schicht länger, wartete die obere. War SDH/SONET-Schutz vorhanden, sollte MPLS ihm Zeit zur Umschaltung lassen.

Diese Wartezeit delegierte Wiederherstellungsautorität. War sie zu kurz, entstand der Wettlauf trotzdem. War sie zu lang, verlängerte sie den Ausfall, falls der untere Schutz fehlte oder scheiterte. Ein Timerwert enthielt somit eine Behauptung über die Konfiguration: Diese Schicht kann diesen Dienst schützen und soll bis zu einem festgelegten Zeitpunkt zuerst handeln.

Bei einer ungeschützten SDH/SONET-Strecke galt das Gegenteil. Auf eine nicht vorhandene Umschaltung zu warten, war reine Verzögerung. Der RFC verlangte einstellbare Werte oder eine sofortige Fehleranzeige nach oben. Höherschichtige Fehler sollten wiederum keinen Schutz unten auslösen: Eine fehlende IP-Route beweist keinen Faserbruch.

Vorgeschlagen wurden 100–500 ms für 1:1-Schutz mit vorab eingerichteter Kapazität, 100–750 ms mit vorgeplanter Kapazität, 50 ms für lokale Wiederherstellung und ein bis fünf Sekunden für eine vom Ursprung veranlasste Pfadwiederherstellung. Signallaufzeit war ausgenommen. Das Team erklärte ausdrücklich, es könne die wissenschaftliche Eignung dieser Grenzen für eine bestimmte Anwendung nicht bestätigen.

Die Zahlen waren also Entwurfsziele, keine Messwerte und keine SLAs. Fehlererkennung, Haltezeit, Umschaltung, Signalisierung, Konvergenz, Laufzeit und Anwendungsabschluss haben eigene Uhren. Eine interne 50-ms-Aktion belegt nicht, dass ein Gespräch oder eine Transaktion fortbestand.

Schutz und Wiederherstellung unterschieden sich auch in der Kapazitätsbindung. Schutz bereitete Ressourcen vor dem Fehler vor; Wiederherstellung wählte danach einen Weg. Vorab eingerichtete Kapazität war gebunden, vorgeplante konnte geteilt werden. Teilen erhöhte die normale Auslastung, verlangte bei mehreren Ausfällen aber Wiederherstellungspriorität und eventuell Verdrängung.

Shared Risk Groups verbanden die logische Sicht wieder mit der Physik. Zwei Links konnten denselben Kabelkanal, dasselbe Kabel, Wegerecht, denselben optischen Ring oder Standort teilen. Ohne SRG-Nachweis konnte ein vermeintlich anderer MPLS-Pfad am selben Bagger scheitern.

Lokale Reparatur nahe am Fehler war schnell, konnte jedoch einen suboptimalen Pfad hinterlassen, der später neu geordnet werden musste. Quellbasiertes Routing nutzte Ressourcen womöglich besser, dauerte aber länger. Erste Paketlieferung und stabiler Zielzustand waren unterschiedliche Meilensteine.

Auch horizontale Grenzen brauchten Rückmeldungen. RFC 3386 verlangte, Erfolg oder Fehlschlag der Wiederherstellung zwischen Gebieten zu übermitteln. Auftrag, Versuch, Teilerfolg und nutzbare Gesamtverbindung waren getrennte Tatsachen.

RFC 4427 vereinheitlichte später Begriffe, RFC 4428 vertiefte Mehrschicht-Wiederherstellung, RFC 7347 behielt eine konfigurierbare Haltezeit für MPLS-TP und RFC 7926 zeigte, wie Abstraktion Risiken der Serverschicht verbergen kann. Das belegt eine fortdauernde Entwurfsfrage, nicht universelle Einsatzerfolge der Werte von 2002.

Lu Hengs Idee einer minimalen Anfangsspezifikation erklärt die lose Kopplung. Reihenfolge, Fehleranzeige und Frist mussten gemeinsam feststehen; interne Algorithmen konnten lokal bleiben. Keine Schicht musste zur allwissenden Autorität werden.

Die Realitätsschichten setzen die Beweisgrenze. Konfigurierter Schutz, erkannter Fehler, Schaltbefehl, abgeschlossene Transportumschaltung, wiederhergestellter LSP, konvergiertes IP und erfolgreiche Anwendung sind einzelne Belege. Ein abgelaufener Timer bestätigt nur verstrichene Zeit.

Die bleibende Lehre lautet daher nicht, immer unten zu beginnen. Wiederherstellungsrecht muss einer nachweislich fähigen Schicht gehören, zeitlich begrenzt sein und bei Fehlschlag mit Ergebnis nach oben zurückkehren. Resilienz entsteht nicht durch möglichst viele Mechanismen, sondern durch eine Ordnung, die verhindert, dass sie um denselben Fehler kämpfen.

Quellen