• O Cloudflare R2 retornou um número elevado de erros 503 no leste da América do Norte desde as 21h10 UTC de 4 de setembro até o início de 5 de setembro
  • Aplicações que dependem do R2 podem apresentar erros de armazenamento aos usuários mesmo quando o incidente se limita a um único produto e uma única região

O fato

Às 0h42 UTC de 5 de setembro, a Cloudflare marcou como resolvido um incidente no serviço de armazenamento de objetos R2 no leste da América do Norte. O incidente começou às 21h10 UTC de 4 de setembro, quando clientes da região registraram um número elevado de erros HTTP 503. O histórico de status da Cloudflare informa que os engenheiros identificaram a causa, implementaram uma correção e monitoraram o serviço antes de encerrar o incidente.

O incidente foi reportado para o R2 no leste da América do Norte, e não como uma indisponibilidade global da Cloudflare. O R2 é o serviço de armazenamento de objetos da Cloudflare, usado para guardar arquivos, recursos e outros dados de aplicações. Portanto, uma aplicação que dependa de objetos armazenados por meio do serviço afetado pode retornar erros aos usuários quando o acesso a esse armazenamento é interrompido.

A avaliação

O incidente foi limitado o suficiente para ser descrito por produto e região, mas as aplicações que usavam esse serviço R2 ainda podiam falhar ao tentar recuperar dados armazenados. Para uma equipe de aplicações, isso torna importante identificar onde está a falha: um erro 503 do R2 aponta para uma solicitação de armazenamento que não pôde ser concluída, em vez de constituir evidência de que toda a plataforma da Cloudflare estava indisponível.

A próxima etapa do diagnóstico depende de saber quais partes de uma aplicação dependem do R2 na região afetada. Um serviço que precisa desses objetos para uma função crítica pode ser afetado imediatamente pelo incidente, enquanto outro pode continuar operando com apenas parte de seu conteúdo indisponível.

As informações fornecidas não estabelecem períodos de indisponibilidade no nível do cliente nem perda de dados, portanto o impacto não deve ser ampliado para além do aumento de erros informado pela Cloudflare. Para os leitores da BTW, a decisão sobre resiliência deve, portanto, ser tomada no nível da carga de trabalho. As equipes precisam saber quais funções da aplicação dependem do serviço de armazenamento antes de decidir qual nível de proteção essa dependência exige.

O que acompanhar

Acompanhe qualquer explicação pós-incidente da Cloudflare e a ocorrência de novos incidentes do R2 no leste da América do Norte. Mais detalhes sobre a causa e a recuperação esclareceriam os limites da falha e se o mesmo padrão regional está se repetindo. Relatos de clientes indicando que os problemas de acesso continuaram após o horário de resolução informado pela Cloudflare também ajudariam a determinar se a recuperação se estendeu além da atualização de status da provedora.