Resumo

  • Em 15 de agosto de 2024, a desativação programada de um antigo núcleo de pacotes 4G da TPG Telecom causou uma falha de voz de 80 minutos. Das 147 tentativas de chamadas de emergência originadas na rede da TPG, 104 chegaram ao serviço por outra rede móvel e 43 não alcançaram o ponto de terminação exigido.
  • O regulador australiano concluiu que a TPG conhecia a falha significativa às 1h22 e havia iniciado uma reversão completa, mas só notificou a entidade responsável pelo 000 e pelo 112 às 9h07. A lacuna transforma o episódio em um teste de preparação da mudança, detecção de falhas parciais e transferência responsável para um terceiro crítico.

A falha atingiu uma cadeia de controles, não apenas um equipamento

Chamar o episódio de uma indisponibilidade móvel curta é correto, mas incompleto. Segundo a Australian Communications and Media Authority, a ACMA, a interrupção visível começou à 0h40 e terminou às 2h de 15 de agosto de 2024. Os 80 minutos são apenas a janela de disponibilidade; o problema de responsabilidade durou mais.

A TPG Telecom executava uma atividade programada para desativar seu antigo núcleo de rede de pacotes 4G. O núcleo móvel é a parte central que reconhece o serviço do aparelho, organiza a sessão e decide para onde uma chamada deve seguir. As torres podem continuar transmitindo enquanto uma falha no núcleo impede a conexão. Para o usuário, o celular parece registrado, mas a ligação não se completa.

A TPG informou à ACMA que realizou testes “críticos para a missão”. Mesmo assim, a mudança derrubou todos os enlaces de sinalização 4G, inclusive aqueles que ainda transportavam tráfego real. Sinalização é o conjunto de instruções que localiza o assinante, monta a chamada e escolhe o caminho. Sem essas instruções, a conversa falha antes de começar.

A maioria dos clientes afetados não conseguia fazer ou receber chamadas de voz ou por Wi-Fi, inclusive chamadas de emergência. Alguns aparelhos específicos com capacidade 5G continuaram funcionando. Essa sobrevivência parcial tornou o incidente mais difícil de enxergar. Os processos automáticos e o monitoramento em tempo real da TPG não identificaram imediatamente que parte dos usuários de 4G não conseguia chamar a emergência.

Portanto, pelo menos cinco controles foram testados: autorização da mudança, proteção dos enlaces ainda vivos, detecção do impacto crítico, decisão de reverter e aviso externo. Reduzir a causa ao primeiro ato técnico esconderia os mecanismos que deveriam conter suas consequências.

Duas contagens de tempo contam histórias diferentes

À 0h40, a mudança programada derrubou a sinalização 4G. À 1h22, a TPG tomou conhecimento da falha significativa. O problema foi escalado para a alta administração, a reversão completa começou e os processos da equipe de gerenciamento de emergência foram ativados.

Reverter significa desfazer a mudança e devolver a rede a um estado que funcionava antes. Iniciar essa ação não prova que cada serviço já voltou; é o começo da recuperação controlada.

Às 2h, o serviço estava totalmente restaurado. Entre 3h22 e 5h42, a TPG fez verificações de bem-estar com usuários cujas chamadas de emergência não haviam chegado. Às 9h07, a empresa contatou a entidade responsável pelas chamadas 000 e 112. Na Austrália, esse papel recebe as chamadas nacionais e as transfere para polícia, bombeiros ou ambulância; a Telstra o exerce para 000 e 112. O relatório da ACMA registra um e-mail às 9h07 e uma ligação telefônica às 9h25.

O primeiro relógio mede indisponibilidade: 80 minutos. O segundo mede coordenação: sete horas e 45 minutos entre o conhecimento organizacional e o primeiro contato. A conclusão regulatória trata do segundo relógio.

Restaurar e notificar não são ações intercambiáveis. A restauração repara o serviço. A notificação entrega contexto a outro participante da cadeia de emergência, para que ele possa agir enquanto o problema existe.

Como uma chamada móvel de emergência percorre a rede

Para quem não é especialista, o caminho pode ser dividido em cinco etapas. Primeiro, o aparelho solicita acesso à rede de rádio, formada pelas torres e pelos equipamentos que ligam o celular à operadora. Depois, o núcleo móvel identifica o serviço e configura a chamada. A operadora encaminha a chamada para a interconexão nacional de emergência. A entidade responsável recebe. Por fim, um atendente transfere a ligação para polícia, bombeiros ou ambulância, com as informações necessárias.

Um desenho técnico pode mostrar caminhos redundantes. Isso não garante que um aparelho usará o caminho alternativo em uma falha parcial específica. Aparelho, rádio, núcleo e interconexão precisam reagir de modo compatível. O monitoramento também precisa reconhecer que a rota principal falhou mesmo quando outras funções continuam saudáveis.

Em uma apresentação posterior ao Senado, a TPG descreve hoje chamadas móveis de emergência passando por seu núcleo com várias camadas de redundância, sendo entregues a uma interconexão da Telstra e acompanhadas por alarmes de escalonamento. O material ajuda a explicar a arquitetura pretendida atualmente. É posterior ao evento e foi produzido pela própria empresa; não comprova que controles idênticos existiam ou funcionavam em agosto de 2024.

A evidência histórica está no resultado operacional: enlaces com tráfego vivo caíram, alguns usuários mantiveram o serviço, outros não, algumas chamadas migraram para redes rivais e outras não chegaram ao destino exigido. O comportamento real da rede é mais informativo do que a redundância desenhada em um esquema.

O “camp-on” reduziu o risco, mas não garantiu continuidade

Durante a falha, 147 usuários tentaram chamadas de emergência originadas na rede da TPG. Cento e quatro chamadas fizeram “camp-on” em Optus ou Telstra e alcançaram o serviço.

Camp-on é o comportamento que permite ao celular usar outra rede disponível para uma chamada de emergência quando a rede de origem não consegue entregá-la. O usuário não precisa ter uma assinatura normal com a outra operadora para esse uso específico.

O mecanismo evitou muitos fracassos e é uma camada importante de resiliência. Mas ele não funcionou para todos.

A ACMA constatou que apenas parte do núcleo da TPG perdeu função. A rede de acesso por rádio não se retirou de uma forma que obrigasse todos os aparelhos a procurar outra operadora. Por isso, 43 chamadas não chegaram ao ponto de terminação exigido.

Uma delas envolvia uma pessoa em roaming internacional. A TPG verificou o bem-estar dos outros 42 usuários. Dezoito disseram não precisar de atendimento urgente. Vinte e quatro foram encaminhados às autoridades policiais de seus estados para acompanhamento, e todos conseguiram fazer chamadas depois da falha. As autoridades confirmaram que pelo menos dois não enfrentavam uma emergência.

Esses fatos não provam morte ou ferimento. Eles provam 43 falhas de entrega. Também demonstram por que uma taxa agregada não resolve a questão: a contingência foi valiosa para 104 tentativas e insuficiente para 43.

Camp-on depende do aparelho, da cobertura disponível, da presença de outra rede e do formato da falha. Deve ser testado como uma camada independente. Não deve servir de justificativa para enfraquecer o controle de mudanças da rede de origem.

Falhas parciais enganam o monitoramento

Uma queda total costuma ser evidente: painéis ficam vermelhos, o tráfego despenca e vários alarmes disparam. Uma falha parcial deixa sinais normais suficientes para sugerir que o conjunto está saudável.

Neste caso, alguns aparelhos 5G ainda faziam chamadas, partes do núcleo funcionavam e a rede de rádio continuava presente. Uma média geral de disponibilidade poderia parecer melhor do que a experiência de um usuário de 4G tentando completar a jornada mais crítica.

O monitoramento de um serviço essencial deve fazer uma pergunta precisa: um usuário representativo consegue concluir a ação importante? Para chamadas de emergência, não basta saber que a torre responde ou que um processo está ativo. É preciso verificar que a chamada se estabelece na tecnologia afetada, alcança a interconexão e é aceita no ponto previsto.

É como um prédio com luz e com a saída de incêndio bloqueada. Medir a eletricidade não diz se as pessoas podem sair. Da mesma forma, a saúde dos componentes não prova a entrega de ponta a ponta.

O relatório público não revela o desenho completo de alarmes nem a matriz de testes da TPG. Seria especulação apontar um alarme específico que faltou. A conclusão segura é mais restrita: os processos automáticos e o monitoramento em tempo real não detectaram imediatamente a incapacidade de alguns usuários de fazer chamadas de emergência pelo 4G.

Ter feito testes não prova a fronteira viva

A referência a testes críticos levanta uma pergunta: o que eles demonstraram? Um ambiente de teste pode não incluir todas as dependências. Um ensaio pode validar o sistema-alvo e ignorar um enlace que ainda carrega tráfego. A sequência da produção pode ser diferente. Uma combinação parcial talvez não tenha sido reproduzida.

Essas são possibilidades gerais, não uma afirmação sobre a causa interna da TPG. O documento público não permite escolher uma. Elas explicam por que a palavra “testado” não deve encerrar a análise.

Antes de retirar um núcleo antigo, a equipe precisa demonstrar quais enlaces estão realmente inativos, como isso foi medido, quais jornadas 4G, 5G e Wi-Fi foram verificadas, qual sinal interrompe a mudança, quem tem autoridade para reverter e como a recuperação será confirmada. Um componente continua sendo produção enquanto transporta tráfego, mesmo que o projeto o chame de legado.

Telemetria de infraestrutura e teste da jornada do usuário são complementares. A primeira observa enlaces, processos e capacidade. O segundo percorre o serviço inteiro. As duas visões devem coincidir antes, durante e depois da mudança.

Reversão e notificação precisam avançar em paralelo

À 1h22, a TPG iniciou a reversão e ativou sua gestão de emergência. Essas ações eram necessárias. Uma resposta madura, porém, divide o trabalho em fluxos paralelos: restaurar, medir impacto, comunicar terceiros e preservar decisões e horários.

Quando toda a atenção vai para o reparo, o aviso pode esperar até a estabilização. É uma reação compreensível, mas arriscada. A entidade responsável pelas chamadas de emergência precisa saber da interrupção enquanto ela ocorre, ou assim que possível depois de a operadora tomar conhecimento. Um aviso posterior não recria a consciência situacional que faltou durante a falha.

A TPG tinha uma política que exigia notificação rápida e disse à ACMA que o atraso ocorreu porque a política não foi seguida. A empresa informou que treinou o pessoal relevante e planejou reciclagem anual. Treinamento é uma resposta razoável, mas a regra é fraca se depender de alguém lembrar uma tarefa separada no auge da reversão.

Um controle mais forte abre automaticamente uma tarefa quando o incidente é classificado como impacto a chamadas de emergência. Atribui um responsável, inicia um prazo, registra o canal e exige confirmação do recebimento. A automação não substitui o julgamento humano; torna visível se a passagem de responsabilidade aconteceu.

O que o regulador efetivamente concluiu

A determinação australiana de 2019 sobre o serviço de chamadas de emergência impõe deveres a operadoras, prestadores e entidades responsáveis pelo atendimento. Seus objetivos incluem acesso, integridade, continuidade e coordenação durante uma interrupção.

O parágrafo 27(2)(a) exigia que, depois de tomar conhecimento de uma falha significativa que afetasse o transporte de chamadas de emergência, a operadora avisasse o mais cedo possível os responsáveis por 000/112 e 106. A investigação deste caso foi limitada ao aviso sobre 000 e 112.

A ACMA considerou 1h22 o momento em que a TPG sabia da falha e 9h07 o momento do contato, muito depois da restauração às 2h. O regulador encontrou uma violação da obrigação de aviso e uma violação decorrente da condição de licença que exige respeito à legislação de telecomunicações. Emitiu uma advertência formal.

Uma advertência não é sentença judicial nem multa. O texto não deve ampliá-la nem diminuí-la. Sua importância está em ligar um dever preciso a uma cronologia verificada.

A norma posterior sobre comunicação com clientes em grandes falhas ainda não estava em vigor no dia do incidente. Ela pode aparecer como contexto de reforma, nunca como fundamento retroativo da decisão.

Responsabilidade sem inventar um culpado individual

O relatório não identifica o engenheiro que executou a mudança nem a pessoa que deveria ter telefonado à Telstra. Não há base para atribuir culpa individual. Ainda assim, a responsabilidade organizacional é específica: a TPG controlava a mudança, o monitoramento, a reversão, a classificação do incidente e o processo de aviso.

O perímetro incluía aprovação, comprovação do tráfego vivo, vigilância da jornada de emergência, autoridade de reversão, comando do incidente e notificação externa. Cada função deve ter dono e registro auditável.

Dizer que uma política não foi seguida não deve encerrar a análise. A próxima pergunta é como o sistema mudou para tornar a mesma omissão menos provável. Treinamento, sondas sintéticas, prazos escaláveis, listas ligadas à gravidade e confirmação externa se reforçam.

O objetivo não é transformar todo erro em punição. É tornar a responsabilidade legível. Para um serviço crítico, a organização deve mostrar o que estava rodando, o que falhou, quando soube, como restaurou e quando transferiu o incidente a quem precisava agir.

Fontes