Resumo

  • O RFC 9940 dá escopos distintos a Value, Event, Fault, Problem, Symptom, Cause, Alert e Alarm; suas explicações de fluxo não autorizam, por si, uma remediação.
  • Um alarme pode sinalizar um estado indesejado, e o trabalho pode ser fechado por um operador, sem que isso prove a causa, a recuperação de todo o serviço ou o direito de fazer a próxima alteração.

Uma linha sobe num gráfico. Um limiar é cruzado. Uma notificação chama alguém. Tudo isso pode ser correto e urgente. O problema começa quando o registro operacional passa a dizer, sem transições visíveis, que a leitura identificou a causa e que a resposta restaurou o serviço. Essa frase mistura objetos que precisam ter evidências diferentes.

RFC 9940, publicado pela IETF como documento Informational em abril de 2026, organiza a terminologia de gestão de falhas e problemas para a camada de rede e abaixo dela. A finalidade é dar entendimento comum a modelos e protocolos que reportam, tornam visíveis ou administram falhas e problemas. O texto não é um mecanismo de descoberta de causa, nem uma prova de resultado do serviço, nem uma autorização para mudar outro domínio operacional.

Uma Characteristic é um aspecto observável ou mensurável de um Resource; um Value é sua medida. Change é a variação de um valor no tempo; Event é uma variação num instante distinto. Condition interpreta valores de uma ou mais características, e State é a condição de um recurso num momento. Portanto, uma medida já precisa de contexto antes de se tornar estado: há janela, frequência, limiar e ponto de vista. Uma amostra de perda não se transforma sozinha em degradação do serviço.

A Relevance é definida com política, perspectiva, intenção e outros dados. Um Event ou Change relevante é uma Occurrence. Um Fault é uma Occurrence indesejada que pode indicar um State indesejado atual ou futuro. Um Problem é um State indesejado que pode exigir ação corretiva, mas não precisa ter uma única Cause. Um Symptom indica um Problem. Uma Cause pode ser sugerida ou determinada a partir de diversos faults, problems e symptoms. Um Alert indica um Fault; um Alarm significa um State indesejado de um recurso que requer atenção corretiva.

O caso de perda de luz de RFC 9940 impede uma conclusão confortável demais. Os serviços podem voltar enquanto a falha recente continua sem explicação. Consertar uma microcurvatura pode resolver uma causa próxima, mas ainda deixar sem resposta como impedir recorrência. Tráfego normal depois do evento é uma observação valiosa sobre o estado atual; não é uma anistia para a investigação histórica.

RFC 8632 traduz essa cautela para o modelo de alarmes. Recursos de causa raiz são candidatos, isto é, pistas fornecidas ao cliente. O RFC também separa is-cleared, estado do alarme, de closed, estado do operador. O primeiro pode dizer que a condição observada não está presente; o segundo que alguém considera bem-sucedida a ação corretiva. Eles podem coincidir, mas nenhum prova sozinho origem, cobertura de medição ou o resultado de cada serviço dependente.

Telemetria não é a intenção do serviço. RFC 9940 encadeia telemetria, monitoração, análise e observabilidade e ressalta que dados de telemetria não carregam a definição do serviço. RFC 9315 descreve intent como objetivos e resultados declarativos, que a rede não conhece automaticamente. RFC 9417 também separa métrica, sintoma, escore de saúde e métrica que não pôde ser coletada. Um escore pode priorizar uma investigação, não autorizar sozinho uma retirada de rota, uma cobrança, o encerramento de um incidente ou uma promessa ao cliente.

Daniel Kade usa as camadas de realidade de docs/heng-lu-note.md como lente editorial, nunca como norma adicional da IETF. Preservar a leitura, a regra de limiar, a política, a classificação, a hipótese causal, a decisão autorizada, a mudança e a observação posterior permite velocidade sem transformar um rótulo familiar numa cadeia completa de evidência.

Fontes