- С 21:10 UTC 4 сентября до раннего утра 5 сентября сервис Cloudflare R2 выдавал повышенное число ошибок 503 в восточной части Северной Америки
- Приложения, зависящие от R2, могут показывать пользователям ошибки хранилища, даже если инцидент ограничен одним продуктом и одним регионом
Что произошло
Cloudflare сообщила, что инцидент в сервисе объектного хранения R2 в восточной части Северной Америки был устранён 5 сентября в 00:42 UTC. Он начался 4 сентября в 21:10 UTC, когда клиенты в регионе столкнулись с повышенным числом ошибок HTTP 503. Согласно истории статусов Cloudflare, инженеры выявили причину, внедрили исправление и наблюдали за работой сервиса, прежде чем закрыть инцидент.
Cloudflare сообщила об инциденте R2 в восточной части Северной Америки, а не о глобальном сбое Cloudflare. R2 — сервис объектного хранения Cloudflare, используемый для файлов, цифровых ресурсов и других данных приложений. Поэтому приложение, зависящее от объектов, которые хранятся в затронутом сервисе, может возвращать пользователям ошибки при нарушении доступа к хранилищу.
Оценка
Масштаб инцидента позволял описать его по продукту и региону, но приложения, использовавшие этот сервис R2, всё равно могли давать сбой при попытке получить сохранённые данные. Для команды, отвечающей за приложение, поэтому важно, где именно произошёл сбой: код 503 при обращении к R2 указывает на запрос к хранилищу, который не удалось выполнить, а не свидетельствует о недоступности всей платформы Cloudflare.
Следующий шаг диагностики зависит от понимания того, какие части приложения используют R2 в затронутом регионе. Сервис, которому эти объекты нужны для критически важной функции, может ощутить последствия сразу, тогда как другой продолжит работать, но часть его контента останется недоступной.
Имеющиеся материалы не подтверждают простои у отдельных клиентов или потерю данных, поэтому последствия не следует оценивать шире, чем повышенное число ошибок, о котором сообщила Cloudflare. Поэтому для читателей BTW решение об отказоустойчивости следует принимать на уровне конкретной рабочей нагрузки. Командам нужно знать, какие функции приложения зависят от сервиса хранения, прежде чем решать, насколько надёжно следует защищать эту зависимость.
За чем следить
Следить стоит за возможными пояснениями Cloudflare по итогам инцидента и новыми сбоями R2 в восточной части Северной Америки. Более подробные сведения о причине и восстановлении помогут прояснить границы сбоя и понять, повторяется ли тот же региональный сценарий. Сообщения клиентов о проблемах с доступом, продолжавшихся после того, как Cloudflare объявила инцидент устранённым, также помогут установить, заняло ли восстановление больше времени, чем указывалось в обновлении статуса поставщика.
Обзор для участников
Подробный контекст профиля
Войдите с подходящим уровнем подписки, чтобы открыть полный обзор и примечания к источникам.
Только для Стратегического сообщества
Стратегическое сообщество
Открыто всем читателям. Вступите и войдите, чтобы открыть обзоры профилей.
Вступить в Стратегическое сообществоТолько для Альянса лидеров
Альянс лидеров
Для проверенных владельцев IP-активов и руководителей. Войдите, чтобы открыть обзоры Альянса.
Вступить в Альянс лидеров

