Resumen

  • El maestro de EAPS puede abrir su puerto secundario en cuanto recibe una alerta LINK-DOWN o vence el temporizador de salud. Ese acto restablece una posibilidad de encaminamiento sin bucle; no certifica el comportamiento de cada VLAN protegida.
  • Un objetivo serio separa el tiempo de detección, la decisión, la conmutación, el vaciado de FDB, el reaprendizaje, la entrega de paquetes y la aceptación de la aplicación. Llamar «recuperación» al primero que termina oculta el resto.

El cronómetro eligió su propia meta

Un operador ve dos marcas: avería detectada y puerto secundario desbloqueado. La diferencia es pequeña y el panel se vuelve verde. El número parece responder a la pregunta que importa: cuánto tardó la red en recuperarse.

En realidad responde a una pregunta mucho más estrecha. Dice cuánto tardó una máquina de estados en permitir tráfico por un camino alternativo. Todavía no dice si las tablas de reenvío olvidaron el camino anterior, si aprendieron el nuevo destino correcto, si hubo inundación inesperada, si se perdieron o duplicaron paquetes, ni si una transacción sobrevivió.

RFC 3619, publicado en octubre de 2003, documenta EAPS versión 1 como RFC informativo. La tecnología fue inventada por Extreme Networks y el texto declara que no especifica un estándar de Internet. El documento atribuye al mecanismo una convergencia inferior a un segundo y, con frecuencia, inferior a 50 milisegundos. Esa cifra pertenece a la descripción histórica del protocolo. No es una medición de una red actual, una garantía de producto ni evidencia sobre un servicio concreto.

La decisión de liderazgo consiste en definir qué reloj se publica. Si el inicio es el primer fallo físico y el final es la apertura de un puerto, el resultado debe llamarse tiempo de conmutación del dominio. Si la promesa es continuidad para el cliente, el reloj solo termina cuando hay prueba de entrega y aceptación en los extremos relevantes.

Una puerta controlada para evitar el bucle

Un dominio EAPS se ejecuta sobre un anillo Ethernet. Un nodo es maestro; los demás son nodos de tránsito. El maestro designa un puerto primario y otro secundario. Durante el estado normal bloquea en el secundario las tramas que no pertenecen a la VLAN de control. Así, un círculo físico se presenta al aprendizaje Ethernet como una topología lógica sin bucle.

Las VLAN protegidas constituyen el ámbito de esa autoridad. La VLAN de control sigue atravesando el puerto secundario para que las tramas de salud puedan recorrer el anillo. Cuando el maestro declara una avería, desbloquea el puerto secundario y permite que las VLAN protegidas utilicen la dirección que sobrevive.

Ese diseño concentra una potestad limitada y comprensible: decidir cuándo una puerta concreta puede reenviar un conjunto concreto de VLAN. No otorga al maestro conocimiento automático sobre rutas externas, colas, capacidad, sesiones o aplicaciones. El registro operativo debe conservar el identificador del dominio, el maestro vigente, la VLAN de control, las VLAN protegidas, ambos puertos, los temporizadores y la versión de configuración.

Sin esos límites, el verbo «recuperó» crece. Una orden de puerto pasa a representar el anillo entero; después representa la red; al final representa al cliente. La claridad que propone Heng Lu exige lo contrario: el registro tiene autoridad para afirmar el acto que ejecutó, no para sustituir la realidad que aún no observó.

Una alerta y un silencio pueden producir la misma acción

EAPS dispone de dos caminos de detección. Un nodo de tránsito que ve caer un enlace envía inmediatamente una trama LINK-DOWN al maestro. A la vez, el maestro emite tramas periódicas de comprobación de salud. Si una no vuelve antes de que venza el periodo de fallo, entra en estado de avería. La consulta periódica cubre el caso en que la alerta se pierde.

Ambos caminos pueden ordenar que se abra el puerto secundario, pero no aportan la misma evidencia. LINK-DOWN es una afirmación positiva de un nodo acerca de un puerto local. El vencimiento es una inferencia a partir de una ausencia: no apareció la trama esperada dentro de la ventana configurada.

El recibo debe preservar cuál de los dos actuó, la interfaz o secuencia relacionada, la hora de observación, el valor del temporizador y si el otro testigo coincidió. Una ausencia puede proceder de rotura, pérdida, congestión o de un problema limitado a la VLAN de control. Una alerta local no enumera todos los servicios afectados. La acción de seguridad puede ser igual sin fingir que la causa y la incertidumbre también lo son.

Esta distinción evita optimizar a ciegas. Reducir el temporizador puede mejorar el número de conmutación y, al mismo tiempo, aumentar falsos cambios de topología. Conservar la procedencia permite saber si la velocidad comprada introduce inestabilidad.

Vaciar la FDB inicia la recuperación, no la termina

Al declarar una avería, el maestro abre el puerto secundario, vacía su tabla de puente y ordena a los nodos de tránsito que vacíen las suyas. Es una forma disciplinada de olvidar. Las ubicaciones MAC aprendidas en la topología anterior ya no merecen confianza.

Pero una tabla vacía contiene menos conocimiento, no más. Los switches deben reaprender con el tráfico de la nueva topología. Los destinos desconocidos pueden inundarse. Un destino silencioso puede tardar en producir evidencia. La primera trama puede enseñar una ubicación durante una fase todavía transitoria.

Por eso el recibo necesita varias marcas: orden de vaciado emitida, vaciado completado por nodo, primer aprendizaje correcto de cada destino crítico, estabilización del volumen de desconocidos y primera transacción aceptada. También necesita pérdida, duplicación, desorden, latencia y conectividad errónea. Sin ellas, «50 ms» describe la velocidad de una orden, no la calidad del resultado.

RFC 4427 ofrece un vocabulario útil posterior: detección, correlación, notificación, conmutación de recuperación y recuperación total son intervalos diferentes. Además, reserva «sin impacto» para una transición sin pérdida, duplicación, desorden ni errores de bits. Esa precisión impide vender una métrica interna como experiencia de extremo a extremo.

El retorno del enlace abre un segundo incidente posible

Cuando el enlace físico vuelve, el maestro aún puede estar en estado de avería y mantener abierto su puerto secundario. Si todo el anillo físico quedara habilitado antes de coordinarse, reaparecería el bucle. RFC 3619 no trata la restauración como una simple inversión instantánea.

El nodo de tránsito que detecta el enlace restaurado bloquea allí las VLAN protegidas y entra en PRE-FORWARDING. El maestro continúa enviando tramas de salud. Cuando una regresa por el puerto secundario, el maestro vuelve al estado normal, bloquea tráfico no perteneciente a control en ese puerto y emite otra orden de vaciado. Después los nodos pueden reconciliarse y volver a reenviar.

PRE-FORWARDING conserva una verdad organizativa valiosa: enlace activo no equivale a permiso de reenvío; permiso no equivale a servicio restaurado. Hay una ventana en la que la realidad física y el consenso distribuido todavía no coinciden.

La conmutación por fallo y la reversión deben recibir identificadores y relojes separados. La segunda transición vuelve a invalidar aprendizaje y puede producir su propia pérdida. Un único incidente que termina con «normal» borra precisamente el punto en que una protección correcta puede causar un problema nuevo.

Varios dominios comparten fibra, no una conclusión

RFC 3619 permite varias instancias EAPS en un switch y varios dominios sobre el mismo anillo. Cada dominio puede tener su propio maestro y conjunto de VLAN protegidas. La infraestructura física compartida no fusiona esas máquinas de estados.

Un dominio puede estar normal mientras otro permanece en avería o en PRE-FORWARDING. Los temporizadores, VLAN de control, maestros y ámbitos pueden divergir. Un panel que colorea el chasis o la fibra sin mostrar el dominio convierte evidencia común en una conclusión demasiado amplia.

Los marcos de recuperación posteriores hablan de dominio de recuperación por esta razón. La protección posee fronteras. Lo que ocurre dentro no demuestra automáticamente los bordes, el tramo anterior, el posterior ni la aplicación. Cuando varias capas reaccionan, los tiempos de espera y políticas de reversión deben evitar que una recuperación deshaga a otra.

El ensayo útil cruza esa frontera: genera tráfico representativo desde el ingreso real hasta el egreso real, observa el comportamiento de paquetes y comprueba la aceptación de la aplicación. No basta con hacer circular una trama de control alrededor del acero compartido.

La rapidez aumenta la deuda de autenticidad

La sección de seguridad de RFC 3619 advierte que quien consiga acceso físico a las conexiones Ethernet podría falsificar tramas de puente o EAPS y perturbar la red. Recomienda cifrado de enlace o protección apropiada de capa superior cuando los ataques activos sean un riesgo importante.

El tipo de trama no se autentica a sí mismo. Solo explica cómo interpretarla. Si una sola señal puede abrir una puerta, vaciar estado distribuido y cambiar el camino de muchas VLAN, su procedencia debe vincularse a una interfaz permitida, una identidad, un dominio, una época de configuración y una secuencia esperada.

La automatización rápida no es el problema. El problema es la autoridad rápida sin rastro. Deben conservarse la trama o contador desencadenante, la decisión del maestro, las órdenes distribuidas y las respuestas de cada nodo. Los cambios imposibles o repetidos merecen alarma. Una VLAN llamada «control» no convierte cualquier mensaje que circula por ella en una instrucción legítima.

El servicio debe cerrar su propio reloj

La cadena mínima contiene observación física, alerta o sondeo, decisión del maestro, acción de puerto, distribución del vaciado, nueva época de FDB, reaprendizaje, resultado de paquetes y resultado de aplicación. Cada eslabón tiene propietario, incertidumbre y posibilidad de reversión distintos.

Medir solo el estado del maestro incentiva temporizadores más agresivos y oculta falsos cambios o reaprendizajes lentos. Medir solo la aplicación impide localizar dónde se perdió el tiempo. La respuesta madura mantiene ambos planos y prohíbe que uno hable en nombre del otro.

EAPS hizo algo importante: acotó una decisión rápida que evita bucles y abre un camino de supervivencia. El rigor consiste en no cobrar dos veces por ese éxito. El puerto secundario puede firmar la conmutación. Los paquetes y la aplicación deben firmar la recuperación que el cliente compró.

Fuentes