Resumen

  • RFC 9544 cuenta intervalos libres, violados y gravemente violados respecto de umbrales configurados; no certifica la precisión del mecanismo de medida.
  • La duración del intervalo, los puntos de observación, la dirección, los paquetes incluidos y la ventana estadística pueden cambiar el significado aunque el ratio final sea idéntico.
  • El documento no define una máquina de estados completa, una causa, una experiencia de usuario ni una compensación contractual: cada salto requiere otra evidencia.

Imaginemos dos informes con el mismo Violated Interval Ratio. En el primero, unos pocos episodios largos afectan una sesión observada por segundos. En el segundo, centenares de microepisodios aparecen en intervalos de diez milisegundos. El porcentaje coincide. La forma del riesgo no.

No hace falta inventar una avería real para entender el problema. Basta con mirar qué conserva un ratio: cuántos intervalos fueron clasificados de determinada manera dentro de un denominador. No conserva automáticamente la secuencia, la mayor interrupción, la distribución entre usuarios ni el efecto sobre una aplicación.

La RFC 9544, publicada en marzo de 2024 como documento informativo de la IETF, define Precision Availability Metrics para servicios gobernados por SLO. Su precisión se refiere al requisito evaluado, no a la exactitud del reloj, del muestreo o del instrumento. El propio texto deja las técnicas de medida precisa como un asunto separado.

Tres estados de intervalo, muchas decisiones previas

Cada intervalo se clasifica como VI, SVI o VFI. Un Violated Interval contiene al menos un parámetro que no alcanza el umbral óptimo configurado. Un Severely Violated Interval cruza un umbral crítico. Un Violation-Free Interval exige que todos los parámetros estén en su nivel óptimo o mejor.

Por eso las categorías no son observaciones puras. Un paquete aporta el hecho medido; la configuración aporta el juicio. RFC 9544 no decide cómo se fijan los umbrales. Tampoco selecciona los elementos de red entre los que se mide: esos puntos pertenecen al SLO aplicable.

La disponibilidad tiene aquí un sentido exigente. Un servicio puede considerarse no disponible cuando viola el SLO aunque la conectividad básica siga en pie. Eso permite reconocer degradaciones reales que un simple ping verde ocultaría. También obliga a no convertir cada VI en “caída total”: el usuario puede haber visto degradación, daño o nada perceptible, según la aplicación y el parámetro.

La cadencia permanece constante durante cada sesión, pero puede elegirse para el servicio. Esa libertad es necesaria y peligrosa para la comparación. Un intervalo largo agrega; uno corto fragmenta. Cambiar la duración cambia el número de oportunidades de violación y la silueta temporal del resultado.

Los recuentos de paquetes violados añaden contexto. Pueden diferenciar un pico aislado de una afectación amplia. No atribuyen causa. Congestión, convergencia de ruta, falta de capacidad, medición incompleta o un extremo ajeno pueden producir contadores parecidos. Una métrica de cumplimiento no sustituye el diagnóstico.

La estadística decide cuándo un caso se convierte en incumplimiento

Un SLO puede admitir que un porcentaje de paquetes supere un objetivo. RFC 9544 muestra un esquema de varios niveles de latencia: un paquete fuera del nivel más estricto no necesariamente viola por sí solo el acuerdo. La ventana y la distribución importan. Los histogramas adaptados a esos niveles quedan para trabajo futuro.

Esta distinción evita dos errores opuestos. El primero es declarar una infracción por cada valor atípico. El segundo es usar el cumplimiento agregado para negar que un usuario sufrió un valor de cola perjudicial. El contrato puede responder a la primera pregunta; la experiencia necesita otra observación.

Los PAM derivados —tiempo o paquetes desde la última violación, medias entre VI, VIR y SVIR— son buenos compresores. Reducen la necesidad de exportar y procesar series enormes. Pero una media no permite reconstruir la cronología, y un ratio sin datos auditables puede ser insuficiente para resolver una disputa.

La sección de seguridad establece una regla decisiva: la instrumentación y la configuración del SLO son objetivos de ataque. Cada instancia de la métrica debe quedar unida al SLO vigente. Si esa unión no puede probarse, es preferible conservar estadísticas de rendimiento y no afirmar qué fue una violación.

“No disponible” todavía necesita una máquina de decisión

RFC 9544 contempla una máquina de estados que podría cambiar de disponible a no disponible después de varios intervalos violados y volver tras varios intervalos limpios. Sin embargo, deja el modelo fuera de alcance. No impone la histéresis, el tiempo de restauración, la alarma ni la penalización.

Tampoco incluye todavía el modelo YANG, los elementos IPFIX, la mayor duración de interrupción o los histogramas mencionados como extensiones. Definir el vocabulario no equivale a haber desplegado todo el sistema de evidencia.

Una afirmación sólida debe encadenar el acuerdo y su autoridad de cambio; la definición del SLO; la topología de observación; el reloj, muestreo y población de paquetes; la identidad de la sesión; datos que permitan auditar la clasificación; la regla de transición; la acción ejecutada; la cláusula de consecuencia; y la evidencia del resultado para el usuario.

La separación de capas de Heng Lu aclara la responsabilidad. El SLO es una regla escrita. El PAM es un registro calculado. La reparación o el crédito son actos. La recuperación del servicio es un resultado. Un ratio puede informar el siguiente nivel, pero no puede apropiarse de él.