Resumo
- A Anthropic classificou o incidente
q2kg8n613kr3como crítico e moveu claude.ai, API do Claude, Claude Code e Claude Cowork de operacionais para interrupção grave. - A atualização posterior delimitou erros elevados entre 19:45 e 21:26 UTC de 29 de julho, uma janela de sintomas de 101 minutos.
- O registro público ficou aberto de 19:49:45 até a resolução às 22:36:20 UTC, um ciclo de investigação e confirmação de aproximadamente 171 minutos.
- Às 21:38, a maioria dos modelos se recuperava, mas requisições e latência ainda estavam elevadas; as quatro superfícies voltaram a operacionais no monitoramento das 22:20.
- A Anthropic não publicou causa, códigos de erro, total ou taxa de requisições malsucedidas, clientes, regiões, mitigação, conclusão sobre integridade de dados ou análise posterior.
- O incidente contemporâneo do GitHub Copilot menciona provedores externos sem nomeá-los; sobreposição de horário não identifica a Anthropic nem prova uma causa comum.
Uma página de status é um contrato de observabilidade
Para o cliente, a página de status promete duas coisas: avisar onde o serviço está degradado e oferecer uma base para decidir quando retomar o trabalho. O registro da Anthropic cumpriu parte desse contrato. Ele nomeou quatro superfícies, atribuiu impacto crítico e preservou uma sequência de investigação, identificação, recuperação parcial, monitoramento e resolução.
A outra parte ficou incompleta. Não há denominador de requisições, taxa de falha terminal, volume por modelo, organização ou região. Sem esses dados, o cliente sabe que o alcance atravessou o catálogo Claude, mas não consegue comparar o problema com sua própria experiência nem calcular disponibilidade.
“Todos os modelos” é uma descrição de amplitude. Não quer dizer que toda chamada tenha falhado. “Crítico” é uma categoria operacional, não porcentagem, número de usuários ou estimativa financeira. As próprias atualizações falam em erros elevados e recuperação gradual, o que impede chamar a ocorrência de indisponibilidade total.
As transições mostram coordenação, não arquitetura
Quando a investigação começou, claude.ai, a API, Claude Code e Cowork passaram juntos de operacionais para interrupção grave. Às 20:33 UTC, a Anthropic afirmou ter identificado uma questão que gerava erros elevados em vários modelos. Às 21:38, disse ver recuperação na maioria, embora requisições e latência continuassem altas; as quatro superfícies mudaram para interrupção parcial.
Às 22:20, todas voltaram a operacionais e o incidente entrou em monitoramento. A resolução foi publicada 16 minutos depois. Essa coreografia mostra um domínio operacional compartilhado: trocar a interface por uma integração direta, ou Code por Cowork, não garantia saída do raio de impacto publicado.
Mas os estados sincronizados não dizem qual camada falhou. Serviço de inferência, roteamento, dependência, implantação ou convenção da própria página poderiam produzir a mesma aparência. A fonte não escolhe entre essas hipóteses. Ela sustenta um perímetro comum, não um diagnóstico técnico.
Também não há prova de defeito nos modelos ou nas respostas. Uma chamada pode falhar antes da inferência, no streaming ou na orquestração. Code e Cowork adicionam sessões, ferramentas e estado acima da chamada. O registro não relata dados perdidos, saídas corrompidas, exposição de informação ou falha de controles de segurança.
O incidente tem um relógio do sintoma e outro da resposta
O registro foi aberto às 19:49:45 UTC. Mais tarde, a Anthropic afirmou que as taxas de erro estiveram elevadas de 19:45 a 21:26. São 101 minutos de sintoma, começando antes da primeira publicação.
A ficha só foi fechada às 22:36:20, cerca de 171 minutos depois da abertura. Esse segundo intervalo inclui investigação, identificação, recuperação, monitoramento e confirmação. Contá-lo inteiro como erro contínuo contradiz o limite retrospectivo dado pelo próprio fornecedor.
Usar somente 101 minutos também empobrece a decisão operacional. Depois de 21:26, as superfícies ainda não estavam formalmente operacionais. Depois das 22:20, havia um período explícito de observação. Para uma fila de produção, o fim do sintoma e a confiança na estabilidade são marcos diferentes.
Repetição automática muda o que “falha” significa
A documentação comum da API da Anthropic descreve o código 500 como erro interno e 529 como sobrecarga temporária. Os SDKs oficiais repetem por padrão, duas vezes e com espera exponencial, algumas falhas transitórias, como conexão, limite e respostas 5xx.
Isso não explica este evento. O registro não revelou códigos HTTP nem atribuiu a causa a sobrecarga. A política apenas mostra por que o denominador precisa ter camadas. Uma operação de negócio pode falhar na primeira tentativa e funcionar na repetição. O usuário percebe demora; o provedor conta duas requisições; a aplicação talvez registre um sucesso final.
Repetições simultâneas também podem elevar tentativas acima da demanda original. A frase das 21:38 sobre requisições e latência elevadas não prova que isso ocorreu. Para medir, seria necessário separar operações originais, tentativas totais, repetições e falhas finais.
Os IDs de requisição documentados pela Anthropic permitem ligar uma operação específica ao suporte. Guardar ID, modelo, horário e resultado é mais útil do que tratar a cor global como explicação suficiente.
O cliente precisa provar a recuperação na carga real
Uma página verde pode iniciar um teste, não liberar automaticamente todo o acúmulo. A equipe pode enviar poucas requisições sintéticas com o modelo, tamanho de contexto, streaming e ferramentas usados em produção. Depois reabre tráfego em etapas e observa erro terminal, latência, idade da fila e conclusão da tarefa de negócio.
Quatro superfícies pedem controles separados. Uma chamada curta à API pode funcionar antes de uma sessão longa de Claude Code ou de um fluxo Cowork. Uma interface também pode degradar enquanto uma integração direta continua útil. O teste precisa representar a carga que realmente importa.
Idempotência limita o dano da retomada. Se a resposta se perdeu depois que uma ação externa foi executada, repetir sem chave pode duplicar efeitos. O plano de contingência deve ainda dizer quais tarefas aceitam outro modelo ou provedor, porque preço, qualidade, contexto, ferramentas, segurança e rota de dados podem mudar.
O relógio do GitHub não fornece um nome
O GitHub abriu às 20:07 UTC uma ocorrência separada sobre provedores de modelos do Copilot. Informou aumento de erros em requisições a provedores específicos ou externos e possível falha ou degradação para alguns usuários. Às 21:51, disse que o provedor externo havia resolvido a questão e que o tráfego do Copilot estava recuperado.
Os horários se sobrepõem à janela da Anthropic. O GitHub, porém, não publicou o nome do provedor, os modelos ou uma causa. Um produto pode usar vários fornecedores; duas ocorrências independentes também podem coincidir. Escrever que a Anthropic causou o problema do Copilot substituiria evidência por correlação.
O registro externo serve como limite editorial e como exemplo de dependência: falha em um fornecedor de modelo pode aparecer como degradação em uma plataforma abaixo dele. Conectar identidades exige que o cliente nomeie o fornecedor ou publique evidência técnica.
O pós-incidente precisa completar a cadeia de medição
Uma análise útil deveria acrescentar taxas máxima e média de falha final, volume total, resultados antes e depois de repetição, distribuição por região e organização e diferenças entre API, site, Code e Cowork. Também deveria identificar a camada que falhou, a ação de mitigação ou reversão e o controle que reduz recorrência.
Conclusões sobre integridade, segurança e dados precisam ser explícitas. O silêncio não prova dano, mas tampouco prova ausência. Sem esses elementos, empresas não conseguem distinguir uma perturbação ampla e rasa de uma interrupção profunda concentrada em cargas críticas.
O fato responsável continua material: todos os modelos e quatro superfícies entraram no perímetro de um incidente crítico, com 101 minutos de erros observados e quase 171 minutos de resposta pública. A Anthropic mostrou a trajetória até o verde. Não mostrou quantas operações terminaram em falha nem por quê. Esse contrato de observabilidade permanece incompleto.

