Résumé
- RFC 3386 a décrit la concurrence entre plusieurs étages capables de réagir à la même panne physique : la protection SDH/SONET pouvait commuter pendant que MPLS préparait déjà un autre chemin.
- Le temporisateur d’attente accordait un droit d’action provisoire à la couche inférieure. Il ne certifiait ni la réussite de la commutation, ni la diversité physique, ni la continuité de l’application.
Une fibre cesse de transporter la lumière. Pour le système optique, c’est un défaut physique. Pour SDH/SONET, c’est un circuit perdu. Pour MPLS, un LSP ne livre plus les paquets. Pour IP, une destination devient difficile à joindre. Quatre observations portent sur un même événement, mais elles n’offrent pas la même preuve et ne donnent pas la même autorité.
Publié en novembre 2002 dans la catégorie Informational, RFC 3386 consignait les besoins pratiques d’une équipe du groupe de travail Traffic Engineering de l’IETF. Il ne normalisait pas un protocole complet de reprise. Son ambition immédiate était plus sobre : réduire le nombre de méthodes incompatibles et préciser comment protection, restauration et hiérarchie pouvaient cohabiter chez les opérateurs.
Le texte séparait la hiérarchie verticale, entre technologies, de la hiérarchie horizontale, entre zones d’une même technologie. La première posait un problème singulier. Chaque couche savait réparer son propre monde, mais les détails de cette réparation restaient souvent invisibles aux autres.
Si tous les étages agissent dès la première alarme, deux reprises peuvent se poursuivre en parallèle. La couche de transport bascule vers une ressource de secours alors que MPLS déplace déjà les flux. La capacité rare est mobilisée deux fois, la topologie change sous le calcul supérieur et le service peut subir deux transitions au lieu d’une.
RFC 3386 proposait alors un mécanisme volontairement imparfait : des temporisateurs imbriqués. Lorsqu’une couche inférieure était censée se rétablir plus lentement, la couche supérieure retardait sa propre action. Dans l’exemple du document, MPLS laissait à la protection SDH/SONET le temps de commuter. L’attente devenait une délégation bornée.
Le réglage révélait un arbitrage. Trop court, il laissait naître la course entre étages. Trop long, il prolongeait une interruption que MPLS ou IP aurait pu contourner. Le temporisateur n’exprimait donc pas seulement des millisecondes ; il déclarait qu’une couche donnée possédait réellement une protection, qu’elle devait agir la première et que son mandat expirait à un moment connu.
Un circuit SDH/SONET non protégé exigeait la décision inverse. Dans ce cas, attendre n’accordait du temps à personne. Le RFC demandait que la valeur puisse être ajustée ou que la couche inférieure signale immédiatement le défaut à la couche supérieure. Une même valeur figée ne pouvait décrire honnêtement une infrastructure protégée et une infrastructure qui ne l’était pas.
L’autorité ne descendait pas symétriquement. Le document précisait qu’une panne d’un étage supérieur ne devait pas déclencher une restauration inférieure. L’absence d’une route IP n’est pas, à elle seule, une preuve de rupture optique.
Les chiffres de temps étaient également circonscrits. Le texte proposait 100 à 500 ms pour une protection 1:1 à capacité préétablie, 100 à 750 ms pour une capacité planifiée, 50 ms pour une restauration locale et une à cinq secondes pour un reroutage depuis la source. La propagation n’était pas incluse, et l’équipe refusait de présenter ces bornes comme une validation scientifique des besoins d’une application précise.
Cette réserve empêche de transformer un tableau de conception en mesure d’exploitation. Une commutation de transport achevée n’atteste pas qu’un LSP est revenu, qu’IP a convergé ou qu’une transaction a survécu. Il faut conserver chaque horloge : détection, attente, commutation, convergence, livraison et observation applicative.
La différence entre protection et restauration complétait le raisonnement. La protection préparait des ressources avant la panne ; la restauration choisissait un nouveau trajet après le défaut. Une capacité préétablie était engagée, tandis qu’une capacité seulement planifiée pouvait être partagée. Ce partage économisait des ressources en temps normal, mais imposait une priorité de restauration et parfois une préemption quand plusieurs demandes arrivaient ensemble.
La notion de groupe de risque partagé rendait visible la couche physique. Deux liens distincts dans MPLS pouvaient suivre le même fourreau, le même câble, le même droit de passage, le même anneau optique ou le même bâtiment. Le chemin de secours n’était indépendant que si l’évidence sur ces risques le démontrait.
La restauration locale pouvait agir près du défaut et gagner du temps, au prix d’un trajet sous-optimal à réorganiser ensuite. Le reroutage depuis la source pouvait mieux employer les ressources mais prenait généralement plus longtemps. Le premier chemin qui recommençait à transporter des paquets n’était pas forcément le chemin stable à conserver.
Aux frontières horizontales, le RFC réclamait aussi un résultat : les zones devaient pouvoir indiquer si la restauration avait réussi ou échoué. Une demande, une tentative et une réussite formaient trois faits différents. Sans ce reçu, l’autre côté pouvait agir inutilement ou croire une connexion entière rétablie alors qu’un segment restait indisponible.
RFC 4427 a ensuite stabilisé un vocabulaire commun, RFC 4428 a approfondi la reprise multicouche, RFC 7347 a conservé un délai configurable pour la protection MPLS-TP et RFC 7926 a montré comment l’abstraction peut masquer un risque partagé dans la couche serveur. Cette continuité intellectuelle ne constitue pas une preuve de déploiement universel des valeurs de 2002.
La grille de Lu Heng sur la spécification initiale minimale éclaire ce choix. L’ordre de reprise, le signal de défaut et la limite temporelle devaient être communs ; les algorithmes internes pouvaient rester locaux. La coordination n’exigeait pas une autorité centrale omnisciente.
Sa distinction entre couches de réalité interdit enfin de confondre configuration et résultat. Protection configurée, alarme reçue, ordre de commutation, commutation achevée, route rétablie et service utilisable sont des enregistrements séparés. Un temps écoulé ne peut pas servir de reçu à la place de l’étage qui devait agir.
La leçon durable n’est donc pas que l’optique doit toujours passer avant MPLS. Elle est qu’un droit de réparation doit avoir un propriétaire, un périmètre, un délai et une voie d’escalade. Le réseau n’est pas résilient parce qu’il possède beaucoup de mécanismes. Il le devient quand chacun sait quand agir, quand attendre et comment rendre la main avec une preuve.
Sources
Briefing des membres
Contexte approfondi du profil
Connectez-vous avec le bon niveau d'adhésion pour débloquer le briefing complet et les notes de source.
Réservé à Strategic Circle
Strategic Circle
Ouvert à tous les lecteurs. Débloquez les briefings de profil après adhésion et connexion.
Rejoindre Strategic CircleRéservé aux membres de Leadership Alliance
Leadership Alliance
Réservé aux propriétaires et dirigeants qualifiés d'actifs IP ; connectez-vous pour débloquer les briefings Alliance.
Rejoindre Leadership Alliance
