Zusammenfassung

  • Licht am Empfänger beweist ein physisches Signal, aber nicht die richtige Gegenstelle. Erst Device-ID, Port-ID und das Echo TLV liefern einen zeitlich begrenzten Identitätsbeleg für die Layer-2-Nachbarschaft.
  • Der Normalmodus lässt fehlende Information als undetermined stehen. Aggressive darf Schweigen erst nach früherer Bidirektionalität, Ablauf des Zustands und letzten begrenzten Wiederholungen in errdisable übersetzen.

Bei einer falsch gepaarten Glasfaser kann jede Empfangsseite Licht sehen, obwohl Sende- und Empfangsfaser nicht dieselben beiden Geräte verbinden. Die Hardware meldet Link, während die gedachte Layer-2-Beziehung gar nicht existiert oder eine Schleife bildet. Das grüne Symbol ist auf seiner Ebene richtig und für die nächste Ebene trotzdem unzureichend.

UDLD fügt einen Identitätsbeleg hinzu. Ein Gerät kündigt Device-ID und Port-ID an; die Gegenstelle gibt im Echo TLV jene Paare zurück, die sie auf demselben Interface tatsächlich gehört hat. Nicht das Licht, sondern die zurückkehrende erwartete Identität begründet die Annahme einer bidirektionalen Beziehung.

Auch dieser Beleg hat Grenzen. Das Protokoll läuft in der Control Plane und hängt von CPU-Last, Scheduling, Implementierung, Timern und Cache ab. Es prüft weder jedes VLAN noch jede Framegröße, Queue, Forwarding-Entscheidung oder Anwendungstransaktion. Ein erfolgreiches Kontrollpaket ist kein End-to-End-Zertifikat.

Ein Nachbareintrag ist eine gealterte Beobachtung

Periodische Hellos halten eine gelernte Gegenstelle nur für die angekündigte Holdtime. Eine neue gültige Nachricht ersetzt den Eintrag und setzt den Timer zurück. Werden Interface oder Protokoll deaktiviert oder das Gerät neu gestartet, wird Zustand gelöscht und eine Bereinigung auf der Gegenseite angestoßen.

show udld ist deshalb kein Livebild des Kabels. Die Anzeige ist das Ergebnis einer Zustandsmaschine aus jüngsten Nachrichten, lokaler Konfiguration und Uhr. Eine Zeile belegt, dass eine Identität innerhalb des Cachefensters akzeptiert wurde. Sie beweist weder denselben Pfad im Augenblick der Abfrage noch das Schicksal des Nutzverkehrs.

Beim Auftauchen eines Nachbarn oder einer Resynchronisierung sieht der RFC eine Nachrichtenfolge vor. Die Annahme lautet, dass bei N Sendungen trotz möglicher Verluste wenigstens eine ankommt. Scheitern alle, bleiben mehrere Ursachen offen: gebrochene Faser, beidseitiger Schaden, hohe Fehlerquote, Duplexkonflikt, überlastete Control Plane, abgeschaltetes UDLD, unfähige Gegenstelle oder eine verlorene Flush-Nachricht.

Normal bedeutet: keine Diagnose aus einer Leerstelle

Der Normalmodus ist ereignisbasiert. Empfangene Informationen können eine korrekte Paarung oder einen ausdrücklichen Echo-Widerspruch zeigen. Fehlen verwertbare Nachrichten, auch nach Verlust einer früher bidirektionalen Kommunikation, bleibt der Zustand undetermined.

Das ist keine Schwäche, sondern saubere Beweisführung. Aktuelle Cisco-Hinweise nennen hohe Fehlerraten und Duplex mismatch als Gründe, weshalb Nachbarinformationen altern können; Paketverlust allein weist keinen unidirektionalen Link nach. Der Ablauf eines Caches rechtfertigt deshalb im Normalmodus keine automatische physische Diagnose und keine Abschaltung.

Der Preis ist operative Ungewissheit. Zähler, optische Leistung, Gegenstellenprotokolle, STP-Änderungen, Datenpfad- und Dienstproben müssen die Lücke schließen. Der Normalmodus bewahrt Verfügbarkeit, verlangt aber bewusst zusätzliche Untersuchung.

Aggressive entscheidet über Folgen, nicht über Bauteile

Im Aggressive Mode zählt die Vorgeschichte. Die Beziehung muss zuvor als bidirektional gegolten haben. Dann läuft der Nachbarzustand ab, der physische Link bleibt up, und letzte Wiederherstellungsversuche bringen die Beziehung nicht zurück. Für einschlägige aktuelle Implementierungen beschreibt Cisco acht Versuche im Abstand von je einer Sekunde vor errdisable.

Der achte Fehlschlag kennt die Ursache nicht besser als der erste. Er markiert lediglich die vorab gewählte Grenze, ab der fehlende Nachbarkommunikation auf einem typischerweise punkt-zu-punkt geführten Link nicht mehr hinnehmbar ist. Kapazität wird entfernt, um eine Schleife einzudämmen oder weiteren Verkehr in ein Black Hole zu verhindern.

Die Abschaltung ist Schutzwirkung, kein Befund über Faser, Transceiver, ASIC, Prozess oder Remote-Konfiguration. Der errdisable-Grund erklärt, warum die Zustandsmaschine gehandelt hat. Wer daraus „UDLD bewies einen unidirektionalen Defekt“ macht, tarnt eine Risikoregel als physische Messung.

Mehrere Uhren laufen gleichzeitig

Während Holdtime und Wiederholungen laufen, können STP oder RSTP die Forwarding-Topologie ändern. Cisco warnt, dass eine feste Rechnung aus klassischen STP-Zeiten nicht garantiert, UDLD werde vor einer RSTP-Transition handeln. Plattform, Release, Medium, Topologie, Timer und Fehlerzeitpunkt bestimmen das tatsächliche Rennen.

Eine belastbare Incident-Chronik trennt daher Carrier, letztes akzeptiertes Hello, Cacheablauf, einzelne Resynchronisierungsversuche, Portabschaltung, STP/RSTP-Rollenwechsel, Ausweichpfad und Anwendungserholung. „UDLD hat es erkannt“ verdichtet verschiedene Belege; „der Dienst ist wieder da“ ist eine spätere, eigene Aussage.

Die bleibende Führungsfrage aus RFC 5171 lautet nicht, welcher Modus generell besser ist. Sie lautet, wer festlegt, wann Abwesenheit unbestimmt bleiben darf und wann zeitlich begrenzte Abwesenheit gefährlich genug ist, um fail-closed zu handeln.

Quellen