Resumo
- O incidente começou por volta de 01h35 JST em 2 de julho de 2022, durante uma manutenção em um roteador central da rede nacional de transporte no centro de rede de Tama. Um procedimento incorreto ou desatualizado omitiu a mudança de rota do VoLTE, deixando uma falha intermitente de resposta que acionou repetidas solicitações de registro de localização.
- A carga das novas tentativas se espalhou pelos controles de chamada VoLTE distribuídos e pelas bases de assinantes. Seis nós de controle gravaram cópias de segurança quando seu estado interno estava inconsistente; ao reiniciar a partir delas, o comportamento anormal não foi removido de forma confiável.
- Recuperar a rede exigiu mais do que desfazer a alteração de rota. A KDDI aplicou controles de fluxo, reinicializações do controle de chamadas, isolamento de PGWs e redefinição de sessões, redistribuição da carga nas bases de assinantes e, por fim, isolamento de seis nós VoLTE que permaneciam anormais.
- O período oficial de serviço afetado foi de 61 horas e 25 minutos, das 01h35 de 2 de julho às 15h00 de 4 de julho. A confirmação de operação normal em todas as redes de telecomunicações ocorreu às 15h36 de 5 de julho, cerca de 86 horas depois do início. São dois relógios operacionais diferentes.
- O Ministério de Assuntos Internos e Comunicações do Japão tratou o caso como acidente grave e apontou falhas em procedimentos, avaliação de risco, desenho contra congestionamento, testes de reinicialização sob carga elevada, recuperação complexa, exercícios e comunicação pública. Reembolsos e medidas corretivas da KDDI foram respostas da operadora, não multa regulatória nem decisão judicial.
Um incidente, dois relógios que não podem ser misturados
A KDDI situa o começo da falha de comunicação por volta de 01h35 do sábado, 2 de julho de 2022, no horário padrão do Japão. Em sua descrição consolidada, a operadora encerra o período afetado às 15h00 da segunda-feira, 4 de julho: 61 horas e 25 minutos. O relatório técnico do Ministério de Assuntos Internos e Comunicações, conhecido pela sigla inglesa MIC, adotou a mesma janela de impacto.
Esse horário, contudo, não encerra toda a cronologia. Segundo a Kyodo News, a KDDI confirmou que todas as redes de telecomunicações estavam plenamente operacionais somente às 15h36 da terça-feira, 5 de julho. Isso ocorreu cerca de 86 horas após o início. O primeiro relógio mede o período que a empresa e o órgão público classificaram como afetado; o segundo termina quando a operadora confirmou a normalidade do conjunto das redes. Substituir 61 horas e 25 minutos por 86 horas alteraria a definição oficial. Usar apenas o intervalo menor apagaria o trabalho posterior de estabilização e verificação.
Entre os dois marcos estavam a retirada de restrições de fluxo, a observação da taxa de sucesso das chamadas, a correção de estados divergentes, os testes de estabilidade e a decisão de que a rede poderia voltar a absorver a demanda normal. Uma rota pode estar corrigida e um equipamento pode ter reiniciado, enquanto as chamadas ainda enfrentam restrições. A palavra “restabelecido”, sem o indicador correspondente, comprime etapas técnicas diferentes em uma afirmação impossível de avaliar.
As estimativas de pessoas afetadas também pertencem a momentos e autores específicos. O relatório do MIC estimou aproximadamente 23,16 milhões de pessoas afetadas na voz e pelo menos 7,75 milhões nos dados. A página consolidada publicada depois pela KDDI informa cerca de 22,78 milhões na voz e ao menos 7,65 milhões nos dados. Já a Reuters, quando a causa detalhada ainda estava sob investigação, noticiou uma exposição potencial inicial de até 39,15 milhões de usuários, incluindo 260 mil clientes corporativos.
Esses números não devem ser somados, promediados ou fundidos em um total supostamente definitivo. O máximo inicial descrevia a população potencialmente exposta durante um evento em andamento. As cifras do MIC e da KDDI vieram de retratos oficiais distintos. Pessoas afetadas em voz e dados podem se sobrepor; contratos, conexões, indivíduos e tentativas de serviço também não são unidades intercambiáveis. Manter a atribuição não é excesso de cautela: é o que impede o texto de criar uma estatística que nenhuma fonte estabeleceu.
A rota omitida produziu uma falha parcial particularmente perigosa
A sequência técnica começou durante a manutenção de um roteador central da rede nacional de transporte no centro de rede de Tama. A investigação do MIC concluiu que o trabalho seguiu um procedimento incorreto ou desatualizado. O documento não determinava a mudança de rota necessária para o tráfego VoLTE, que continuou apontado para um caminho que já não operava como previsto.
O problema não se apresentou como uma interrupção limpa e total. O MIC reconstruiu uma condição em que aproximadamente uma de cada duas respostas falhava. Essa diferença foi decisiva. Quando nada responde, um sistema pode reconhecer uma falha dura e migrar para uma alternativa conhecida. Quando algumas solicitações funcionam e outras não, o caminho parece saudável o suficiente para continuar sendo usado.
A voz sobre LTE depende do registro de localização. Antes de completar chamadas recebidas ou efetuadas, o aparelho precisa ser reconhecido como assinante autorizado e registrar onde está acessível. Quando a confirmação não retorna, o aparelho e as funções da rede consideram o registro incompleto e tentam novamente.
Uma nova tentativa é racional para um único aparelho. Ela se torna perigosa quando milhões de terminais e funções distribuídas tomam a mesma decisão ao mesmo tempo. Cada resposta perdida gera outra solicitação. Cada solicitação consome mais capacidade de controle de chamadas e de consulta às bases de assinantes. Com menos capacidade disponível, mais respostas falham e alimentam novas tentativas. A rede passa a ampliar o defeito que a atingiu.
O MIC estimou carga em torno de sete vezes o normal nas funções de controle VoLTE de Tama. Nos demais locais VoLTE, a carga chegou a aproximadamente 6,5 vezes o normal, à medida que a arquitetura distribuía trabalho e repetição por todo o país. Um erro local de manutenção ingressou em um sistema de controle nacionalmente acoplado.
Esse é o primeiro limite da análise de responsabilidade. O procedimento incorreto explica por que o tráfego anormal começou, mas não explica sozinho por que a falha se espalhou nacionalmente nem por que durou dias. Para isso, é preciso examinar como a topologia em operação distribuiu a sinalização, como a lógica de repetição reagiu à perda parcial e se a proteção contra congestionamento reconheceu esse estado como anormal. O evento não deve ser chamado de vazamento de BGP, sequestro de rota, ataque cibernético, incidente de DNS, falha de espectro ou simples defeito de equipamento; esses rótulos não correspondem ao mecanismo apurado.
A congestão de voz alcançou o estado dos assinantes
Os nós VoLTE não funcionavam isoladamente. O registro de localização e a criação de sessões de voz dependiam de bases de assinantes usadas para autenticação, políticas, cobrança e estado de localização ou serviço. Quando cresceram as novas tentativas de VoLTE, aumentaram também as solicitações dirigidas a essas bases.
O relatório descreve um ciclo de reforço. A base congestionada devolvia erros. Esses erros levavam aparelhos e funções da rede a enviar mais solicitações. O volume adicional produzia ainda mais congestionamento. Em alguns modelos de aparelho, a falha ao estabelecer a sessão de voz também afetava o estado registrado do terminal; assim, os dados podiam ficar indisponíveis de forma intermitente mesmo que a base específica de dados não fosse o ponto inicial do congestionamento.
Essa distinção precisa permanecer clara na comunicação ao público. A evidência mostra uma falha nacional de comunicações com efeitos sobre voz, SMS e dados relacionados ao comportamento dos aparelhos ou às restrições de fluxo. Ela não mostra que todo o serviço móvel de dados do Japão tenha permanecido continuamente indisponível durante o incidente inteiro.
O excesso de carga também prejudicou a consistência do estado de controle. Mudanças repetidas nas sessões de autenticação não eram sincronizadas corretamente em alguns nós de controle VoLTE. Seis deles gravaram cópias periódicas enquanto o estado interno estava divergente. Quando as funções foram reiniciadas usando as cópias mais recentes, os seis nós retornaram com o comportamento anormal ainda presente.
Reinicializar, portanto, não era sinônimo de recuperar. O equipamento voltou a executar, mas o estado carregado continuou causando falhas de autenticação e novas tentativas de registro. A ação que normalmente limpa um problema preservou parte dele porque o próprio registro usado na recuperação refletia um sistema congestionado e não convergente.
Também surgiu uma divergência entre funções VoLTE, bases de assinantes e os gateways da rede de pacotes, os PGWs. Informações de sessão que deveriam ter sido excluídas nem sempre eram removidas durante a congestão da base. Sessões novas podiam então entrar em conflito com estados que haviam permanecido no sistema. Corrigir a divergência exigia fazer componentes distintos convergirem sem ultrapassar novamente a capacidade já pressionada.
Essa é a lição mais forte sobre a realidade operacional. Uma cópia de segurança é um registro, mas sua existência não comprova que o estado salvo esteja limpo. Um procedimento documentado expressa intenção, mas o resultado depende dos dados carregados, do tráfego recebido e das relações entre sistemas. A operadora precisa demonstrar que a recuperação mudou a rede para um estado coerente, e não apenas que um comando terminou.
A recuperação foi uma sequência, não um botão
A resposta da KDDI combinou intervenções diferentes. O MIC relacionou controles sobre solicitações de conexão e tráfego VoLTE, reinicializações de funções de controle de chamadas, isolamento de alguns PGWs para reduzir a carga das bases de assinantes, redefinição de sessões PGW para corrigir informações divergentes e mudanças nos recursos de banco que recebiam o tráfego desses gateways.
Cada ação tratava uma parte do ciclo. O controle de fluxo reduzia a demanda nova. O isolamento de PGWs e a redefinição de sessões mudavam o estado apresentado às funções de assinantes. A redistribuição de carga evitava que um caminho de banco continuasse como limite. As reinicializações tentavam remover processamento anormal. Nenhuma dessas medidas, sozinha, representa de forma justa toda a recuperação.
Os seis nós de controle VoLTE que conservaram o estado anormal foram especialmente difíceis. O MIC registrou que uma tentativa de bloqueio não terminou normalmente porque os nós já estavam em condição anormal. Eles continuaram produzindo sinalização excessiva mesmo depois que outras medidas reduziram fontes de carga. O isolamento final desses seis nós interrompeu a origem persistente das novas tentativas; depois disso, a congestão recuou.
A ordem dos fatos expõe uma deficiência comum na linguagem de restabelecimento. Uma operadora pode concluir a intervenção física ou de configuração que planejou enquanto a rede em execução continua congestionada. Pode devolver a maior parte dos caminhos de dados enquanto a voz permanece limitada. Pode observar taxas de sucesso próximas do normal e ainda precisar inspecionar sistemas afetados por horas de carga elevada.
Mais tarde, o MIC criticou a maneira como a KDDI distinguiu “conclusão do trabalho de recuperação” de “retomada completa do serviço”. A intenção da empresa era informar que, após o trabalho, ainda viriam a retirada dos controles de fluxo e a verificação de normalidade. Parte dos usuários e da imprensa entendeu o primeiro anúncio como serviço já recuperado, embora a congestão e as restrições continuassem.
Não foi apenas um problema de redação. A linguagem revelou uma insuficiência de medição. Se o acompanhamento do incidente não consegue dizer quais condições técnicas e quais resultados para o usuário já foram confirmados, os comunicados recorrem a expressões vagas. Um modelo mais forte separa: defeito inicial removido, crescimento das novas tentativas contido, congestão em queda, sessões coerentes, controles de fluxo retirados, voz e dados estáveis e serviços dependentes verificados de ponta a ponta.
A interrupção atravessou a tela do celular
O relato da KDDI cita efeitos sobre atualizações de entregas e comunicação com motoristas, carros conectados, coleta de dados meteorológicos, medidores de água, caixas eletrônicos bancários, comunicações sem fio em aeroportos e pagamentos em ônibus. A Reuters também documentou problemas envolvendo dados meteorológicos, encomendas, bancos e veículos conectados.
Esses exemplos mostram por que a continuidade do núcleo móvel é uma questão de infraestrutura compartilhada. Uma conexão móvel pode ser o caminho de controle ou de informação de outro serviço. Para uma pessoa, a pane aparece como um telefone que não completa a chamada. Para uma empresa de logística, pode ser a ausência de atualização do motorista. Para um órgão público, a perda de observações. Para transporte ou finanças, uma transação rotineira que o terminal remoto não conclui.
O alcance dessas dependências não autoriza uma generalização maior. As fontes não estabelecem que todos os serviços listados tenham falhado nacionalmente durante as 61 horas e 25 minutos. Elas demonstram a extensão das relações de dependência, não um relógio universal para cada atividade.
As chamadas de emergência concentram a consequência mais aguda. A Reuters noticiou a preocupação do ministro das Comunicações de que chamadas de incêndio e emergência destinadas a proteger vidas e bens haviam sido prejudicadas. A Kyodo informou depois que alguns usuários não conseguiram ligar para os números japoneses 110 ou 119 por um período prolongado. O conjunto de informações públicas não quantifica tentativas de emergência que falharam, ocorrências únicas, feridos ou mortes.
Não há razão para preencher essa lacuna com especulação. O que está sustentado já é grave: o acesso a números de emergência foi prejudicado durante uma longa interrupção móvel nacional. A questão de responsabilidade é se a operadora consegue demonstrar que as comunicações de emergência dispõem de uma rota resiliente quando o registro de voz, a autenticação de assinantes ou o controle normal de tráfego falham.
O registro regulatório identifica falhas de controle, não toda responsabilidade jurídica
O MIC tratou a interrupção como acidente grave e reuniu uma verificação técnica específica. A conclusão não reduziu a causa a um erro humano. Ela apontou deficiências na escolha e aprovação dos procedimentos, na confirmação de normalidade do serviço, na avaliação de riscos, no desenho de controle de congestionamento, na análise de propagação nacional, nos testes de reinicialização sob carga elevada, nos processos de recuperação complexa, nos exercícios e na informação ao cliente.
Esse achado em camadas importa. Um procedimento errado pode iniciar um evento, mas a resiliência nacional precisa pressupor que pessoas e documentos às vezes falham. Respostas parciais devem ser reconhecidas; novas tentativas precisam ter limites; a arquitetura distribuída precisa de zonas de contenção; cópias e reinicializações devem ser testadas em carga anormal; e as equipes precisam praticar uma saída para estados que a automação comum não resolve.
A KDDI informou mudanças como maior rigor sobre procedimentos e aprovações, melhor detecção de congestão, revisão do desenho dos controles, novas rotinas e ferramentas de recuperação e informação mais clara aos clientes. As medidas respondem aos caminhos de falha identificados. A documentação pública, porém, não oferece uma verificação atual, independente e abrangente de sua eficácia em 2026. Informar a implantação de uma medida não demonstra, por si só, seu desempenho atual em toda a rede.
A empresa também anunciou compensações. Sua página consolidada separa os reembolsos previstos em contrato para clientes que ficaram sem qualquer comunicação por mais de 24 horas seguidas, ou em situação equivalente, de um reembolso de 200 ienes a título de desculpas para um grupo muito maior. A Kyodo estimou custo de aproximadamente 7,3 bilhões de ienes e relatou uma redução salarial voluntária do presidente da KDDI.
Essas são respostas comerciais e de governança da operadora. Não constituem multa monetária imposta pelo órgão regulador, sanção criminal nem declaração judicial de responsabilidade. O registro sustenta a classificação de acidente grave, as conclusões técnicas do MIC, as medidas corretivas relatadas e o programa de compensação. Não sustenta transformar esses resultados em julgamento jurídico ou culpa individual que as fontes não descrevem.
A evidência de continuidade deve retratar o serviço em execução
O incidente sugere uma hierarquia prática de evidências. No primeiro nível está o estado pretendido: procedimento aprovado, rota esperada, controles configurados, plano de recuperação e política de comunicação. Esses registros são necessários, mas dizem como a organização espera que a rede se comporte.
No segundo nível está o estado técnico observado. É preciso saber por qual caminho a sinalização VoLTE realmente passa, se as confirmações retornam, para onde as novas tentativas são distribuídas, quais nós estão sincronizados, se as sessões de assinantes e PGWs concordam e se uma reinicialização usou uma cópia limpa. Essas medições descrevem o que a rede faz, e não o que o documento diz que ela deveria fazer.
O terceiro nível é a conclusão do serviço. Um nó saudável não prova que usuários conseguem registrar aparelhos, fazer e receber chamadas, enviar mensagens, usar dados ou alcançar uma central de emergência. A recuperação exige testes de ponta a ponta em aparelhos, regiões, serviços e organizações dependentes representativos. O anúncio público deve seguir esses resultados.
Relatórios regulatórios preservam uma memória essencial do incidente. Eles fixam termos, números, cronologia e expectativas corretivas. Mas um relatório não transporta tráfego, não interrompe novas tentativas, não concilia sessões e não completa uma chamada de emergência. Seu valor operacional está em converter o ocorrido em testes exigidos para a rede que continua funcionando.
Assim, a pergunta decisiva depois da pane de 2022 não é apenas se a rota original foi corrigida. É se os controles atuais conseguem demonstrar que uma falha intermitente semelhante permanecerá local, que a demanda repetida terá limite, que os dados usados para recuperar são confiáveis, que as equipes conservarão visibilidade e que a linguagem dos comunicados corresponderá ao que os clientes de fato conseguem fazer.
O que as informações públicas não estabelecem
O relatório do MIC reconstrói a sequência em detalhe, mas não expõe todos os registros internos, cada comando de recuperação, todo responsável por decisões ou um censo completo dos efeitos por aparelho. Também não quantifica chamadas de emergência malsucedidas, ocorrências únicas, feridos, mortes ou prejuízo econômico.
As estimativas oficiais mudaram entre momentos da apuração. Isso não as torna inúteis; exige que cada uma mantenha autor e método. A cifra inicial de até 39,15 milhões pertence ao relato de exposição potencial durante a investigação. As estimativas de 23,16 milhões na voz e ao menos 7,75 milhões nos dados pertencem ao MIC. Os valores posteriores de 22,78 milhões e pelo menos 7,65 milhões pertencem à página da KDDI. Não há base para combiná-los em outra cifra.
Uma lista de medidas adotadas ou planejadas em 2022 tampouco comprova a eficácia atual. Uma ferramenta pode ter sido instalada sem cobrir todos os nós relevantes. Um procedimento pode ter mudado sem ser testado contra perdas intermitentes e carga nacional de repetição. Um exercício pode funcionar em laboratório sem reproduzir o estado divergente dos assinantes.
Esses limites não enfraquecem a responsabilização; eles a mantêm ligada ao demonstrável. O incidente começou com uma falha concreta de manutenção e roteamento, cresceu por mecanismos observáveis de repetição e congestionamento, persistiu por estados divergentes, alcançou serviços essenciais e exigiu uma recuperação em várias etapas. A conclusão responsável trata de controles e resultados verificáveis, não de dano inventado, culpa pessoal ou decisão jurídica inexistente.
Fontes
- KDDI, “A falha de comunicação de 2 de julho e nossa resposta”
- Conselho de Verificação de Acidentes de Telecomunicações do MIC do Japão, relatório sobre o acidente grave de 2 de julho de 2022 envolvendo KDDI e Okinawa Cellular
- Reuters via Euronews, “KDDI tenta restabelecer serviço no domingo após impacto potencial sobre 40 milhões de usuários”
- Kyodo News, “KDDI compensará 36 milhões de pessoas afetadas pela interrupção da rede”
Briefing para membros
Contexto aprofundado do perfil
Faça login com o nível de assinatura correto para desbloquear o briefing completo e as notas das fontes.
Apenas para Strategic Circle
Strategic Circle
Aberto a todos os leitores. Desbloqueie Briefings de perfil após se inscrever e fazer login.
Junte-se ao Strategic CircleSomente para Leadership Alliance
Leadership Alliance
Para proprietários e gestores qualificados de ativos de PI; faça login para desbloquear os briefings da Leadership Alliance.
Junte-se ao Leadership Alliance
