Resumo

  • Uma análise externa constatou que a Telstra não tratava a sincronização da rede como uma capacidade crítica e identificou falhas de responsabilidade, supervisão, conhecimento especializado e controles operacionais
  • A Telstra transferiu os serviços para seu sistema estratégico de sincronização e está verificando outras funções críticas da rede em busca de fragilidades semelhantes

O fato

A Telstra começou a revisar outras funções críticas da rede depois que uma investigação externa sobre a interrupção de julho constatou que a sincronização da rede não era gerenciada como uma capacidade crítica. A Technology Audit Partners confirmou que o sistema de sincronização causou a interrupção e identificou responsabilidades pouco claras, supervisão limitada de ponta a ponta, conhecimento especializado insuficiente e fragilidades na gestão de mudanças, no controle de configurações, na documentação e na gestão de incidentes, segundo a Telstra.

A Telstra afirmou que, desde então, migrou os serviços dos servidores NTP anteriores para seu sistema estratégico de sincronização nos três locais, acrescentou recursos de monitoramento e alarmes e ampliou os testes em laboratório antes de mudanças na rede. Um programa de correção em toda a empresa está em andamento, enquanto a operadora também examina outras funções críticas da rede em busca de falhas semelhantes. A análise ocorre após a interrupção de julho, que afetou serviços móveis e de telefonia fixa em toda a Austrália, além de outros serviços que dependiam da rede da Telstra.

A avaliação

A falha de julho foi técnica, mas a análise aponta um problema na forma como a função de sincronização era gerenciada antes que qualquer falha ocorresse. A Telstra não a tratava como uma capacidade crítica, com responsabilidade clara de ponta a ponta e os controles que essa condição exigiria. Como a sincronização dá suporte a muitos elementos da rede, fragilidades em sua manutenção ou supervisão podem permanecer despercebidas até que uma mudança as revele.

A transferência dos serviços para o sistema estratégico de sincronização resolve o problema do ambiente imediato. A análise mais ampla é importante porque a Telstra agora busca saber se outras funções essenciais da rede apresentam falhas semelhantes de responsabilidade, documentação, monitoramento ou suporte especializado. Esse trabalho pode revelar problemas antes que outra mudança rotineira os transforme em uma interrupção.

Para os leitores da BTW, a mudança importante está no escopo. A Telstra deixou de tratar o episódio de julho apenas como a falha de um componente de sincronização e está usando o incidente para examinar como outras funções críticas são classificadas, mantidas e atribuídas a responsáveis em toda a rede.

O que observar

É importante observar se a Telstra identificará outras funções da rede abrangidas pela análise e divulgará as mudanças realizadas. A designação de responsáveis, a atualização de documentos de manutenção, novos recursos de monitoramento, testes em laboratório e migrações concluídas forneceriam evidências de que o programa está avançando além da falha original de sincronização. A identificação de fragilidades semelhantes em outras áreas mostraria até que ponto o problema se estendeu para além do incidente de julho.