Resumen

  • EVPN elige un DF para el tráfico multidestino hacia un segmento multihomed, pero el PE ganador puede tener caído el circuito del servicio.
  • Los retiros de rutas ES y A-D aceleran la convergencia, sin probar tablas sincronizadas, split horizon correcto o continuidad de paquetes.
  • RFC 8584 explica cómo un fallo lógico del acceso puede mantener estable la lista de candidatos y aun así crear un agujero negro.
  • La prueba de failover une elección, estado de servicio, programación de hardware y mediciones bidireccionales.

En un mantenimiento hipotético, dos PE siguen visibles para el mismo segmento. El panel confirma que el de respaldo pasó a ser DF para la VLAN afectada. BGP está estable y se detiene el reloj del incidente. Sin embargo, el tráfico broadcast, unknown-unicast y multicast desaparece porque el circuito de ese servicio está caído en el PE elegido. La elección es correcta; la conclusión sobre el servicio no.

El ejemplo no atribuye un fallo real. Aísla la distancia entre asignar una responsabilidad y comprobar la entrega.

Qué decide la elección

RFC 7432 define el service carving predeterminado. Los PE anuncian rutas Ethernet Segment, esperan la lista de candidatos, ordenan las direcciones de origen y aplican al tag Ethernet el módulo correspondiente al número de PE. El DF desbloquea el tráfico multidestino hacia el segmento; los no-DF continúan descartándolo en esa dirección.

La función evita duplicados y bucles. En All-Active, el unicast conocido puede usar varios PE mientras el DF controla la salida BUM. En Single-Active, la responsabilidad activa es más amplia. Ninguno de los modos convierte la elección en una prueba de cada attachment circuit, bridge domain, etiqueta o enlace agregado del CE.

Los retiros también tienen alcances distintos. Retirar la ruta ES vuelve a ejecutar el carving. Retirar A-D por ES permite actualizar next-hops de muchas MAC con rapidez. La etiqueta ESI sostiene el split horizon. RFC 7432 reconoce la fase transitoria en que dos PE podrían creerse DF antes de que termine la elección.

Una lista estable puede ocultar un servicio roto

RFC 8584 muestra que el algoritmo módulo puede repartir mal y remapear servicios sanos cuando cambia el conjunto de PE. Más grave: un AC individual o una MAC-VRF puede estar inactivo mientras otros servicios mantienen activa la ruta ES. Como la lista no cambia, los PE remotos no repiten la elección por defecto.

El resultado puede ser un agujero negro BUM en All-Active o la pérdida de todo el tráfico del CE afectado en Single-Active. El marco extensible permite acordar algoritmo y capacidades, incluida la conciencia del estado del AC. Aun así, queda por demostrar que todos programaron el mismo rol y que los paquetes atravesaron la transición dentro del objetivo.

Medir la transición y el retorno

Para un ESI, EVI y tag determinados, registrar candidatos, algoritmo, capacidades y DF/NDF antes y después. Añadir modo de redundancia, eventos ES/A-D, AC y bridge domain, etiquetas, split horizon, MAC, next-hops y estado del CE.

Probar ambos sentidos con unicast conocido y BUM. Medir pérdida, duplicación, bucles, reordenamiento y tiempo de convergencia durante fallo, estabilidad y recuperación. Confirmar que el antiguo DF bloquea, el nuevo reenvía y el PE recuperado no causa un segundo recarving disruptivo.

Fuentes