Resumo

  • RFC 3386 descreveu a corrida entre proteções de camadas diferentes: SDH/SONET podia desviar um circuito enquanto MPLS já tentava reconstruir o caminho acima.
  • O temporizador dava à camada inferior uma prioridade limitada. Ele organizava a ação, mas não comprovava que a troca, a diversidade física ou a experiência da aplicação tinham sido restauradas.

Uma escavação rompe uma fibra. A óptica registra perda de luz. O transporte perde o circuito. MPLS deixa de entregar no LSP. IP percebe queda de alcançabilidade. A falha é uma só, porém chega a cada camada com evidências e poderes diferentes.

O RFC 3386 foi publicado em novembro de 2002 como Informational. Um grupo de projeto do Traffic Engineering Working Group da IETF reuniu requisitos imediatos de sobrevivência e hierarquia em redes de provedores. O documento não padronizou um protocolo completo nem narrou um caso real. Tentou reduzir a variedade de soluções incompatíveis a um conjunto pequeno e prático.

Sua separação entre hierarquia vertical e horizontal era decisiva. A vertical ligava tecnologias como óptica, SDH/SONET, MPLS e IP. A horizontal separava áreas ou domínios dentro da mesma tecnologia. Na vertical, cada camada podia ter proteção própria, mas sua operação permanecia opaca para as demais.

Essa opacidade criava uma corrida. Se SDH/SONET comutasse enquanto MPLS rerroteava, o tráfego poderia mudar duas vezes. Recursos de reserva seriam ocupados por dois controladores para resolver o mesmo defeito. A topologia usada pelo cálculo superior mudaria por baixo dele. Somar mecanismos de recuperação não somava automaticamente resiliência.

O remédio de curto prazo era deliberadamente simples: tempos aninhados. Quando a camada inferior demorava mais, a superior suspendia sua ação por uma janela. No exemplo do RFC, o temporizador de recuperação MPLS precisava permitir que a proteção SDH/SONET terminasse primeiro.

A janela era uma delegação, não uma garantia. Curta demais, deixava as duas camadas competir. Longa demais, prolongava a falha se a proteção inferior não existisse ou não funcionasse. Configurá-la significava declarar que aquela camada tinha capacidade real de proteger o serviço e que sua autoridade expirava em um prazo conhecido.

Em um circuito SDH/SONET não protegido, esperar seria apenas atraso. Por isso o documento exigia valores ajustáveis ou uma indicação imediata da falha para cima. A camada superior deveria recuperar sem aguardar uma ação inexistente. O caminho inverso não era simétrico: uma falha superior não deveria disparar proteção inferior, pois uma rota IP perdida não prova ruptura óptica.

O texto propôs 100–500 ms para proteção 1:1 com capacidade preestabelecida, 100–750 ms com capacidade preplanejada, 50 ms para restauração local e um a cinco segundos para restauração de caminho pela origem. A propagação estava fora dessas contas. A própria equipe recusou-se a assegurar que os limites satisfizessem cientificamente uma aplicação específica.

Esses valores eram pontos de engenharia, não medições nem SLAs. Entre o defeito e o usuário há detecção, espera, comutação, sinalização, convergência, propagação e conclusão da aplicação. Um circuito que muda em 50 ms pode coexistir com uma sessão que não sobreviveu.

Proteção e restauração também distribuíam capacidade de modo diferente. A proteção preparava recursos antes da falha; a restauração escolhia um novo caminho depois. Capacidade preestabelecida já estava comprometida. Capacidade apenas planejada podia ser compartilhada, elevando a eficiência normal, mas exigindo prioridade e preempção quando várias conexões falhassem juntas.

O grupo de risco compartilhado trazia o mapa físico para a decisão. Links distintos podiam passar no mesmo duto, cabo, faixa de domínio, anel óptico ou prédio. Sem esse registro, duas rotas MPLS visualmente diferentes podiam desaparecer com o mesmo evento físico.

A restauração local perto da falha ganhava velocidade, mas podia deixar um desvio ineficiente que seria reorganizado depois. A restauração pela origem usava melhor a visão de rede, porém normalmente levava mais tempo. Voltar a transportar pacotes e atingir um estado estável eram marcos diferentes.

Nas fronteiras horizontais, o RFC também pedia um recibo de sucesso ou fracasso. Solicitar recuperação não era completá-la; recuperar um segmento não era restaurar toda a conexão. Sem resultado explícito, o outro lado podia agir de forma redundante ou preservar metade de um serviço ainda quebrado.

RFC 4427 consolidou a terminologia; RFC 4428 aprofundou a recuperação multicamada; RFC 7347 manteve espera configurável em MPLS-TP; RFC 7926 mostrou como a abstração pode esconder riscos da camada servidora. A sequência confirma a persistência do problema, não a implantação universal dos tempos sugeridos em 2002.

A especificação inicial mínima de Lu Heng ajuda a entender a preferência por coordenação frouxa. Ordem, indicação de falha e prazo precisavam ser comuns; algoritmos e topologia interna podiam continuar locais. Não era necessário transformar uma camada em autoridade soberana sobre todas as outras.

Já as camadas de realidade separam configuração de resultado. Proteção habilitada, falha detectada, comando emitido, troca concluída, LSP restaurado, IP convergente e aplicação funcional são recibos distintos. O relógio só informa que um prazo passou.

O legado do RFC 3386 não é mandar a camada superior esperar sempre. É exigir que a prioridade de recuperação corresponda a uma capacidade comprovável, tenha duração limitada e termine com escalada e resultado. Resiliência não é quantidade de mecanismos; é a disciplina que impede esses mecanismos de disputar a mesma falha.

Fontes