Кратко

  • Критический инцидент в MKC1 начался 19 августа в 11:10 UTC и затронул несколько стоек и узлов, а на разных этапах — GPU, DOKS, связь и управление кластерами.
  • В 19:34 DigitalOcean объявила инцидент решённым после восстановления региональной плоскости управления и широкого набора сервисов, но сообщила, что GPU Droplets по-прежнему затронуты и возврат всех узлов продолжается.

Публичная запись об аварии и реальная очередь восстановления могут завершаться в разное время. В случае MKC1 DigitalOcean сама зафиксировала эту границу: общая инфраструктура региона позволила закрыть инцидент, хотя часть GPU-мощностей ещё не вернулась.

Первое сообщение появилось в 11:10:06 UTC. Проблема затронула несколько стоек и узлов Канзас-Сити; возможными последствиями назывались перебои GPU-нагрузок и переход рабочих узлов DigitalOcean Kubernetes (DOKS) в состояние NotReady. Уровень влияния был критическим.

В 12:22 компания заявила, что определила первопричину и внедряет меры исправления, но не раскрыла сам механизм. В перечень возможных последствий вошли GPU-нагрузки, Serverless Inference, рабочие узлы DOKS, недоступность Kubernetes API и операций управления затронутыми кластерами. В 15:28 инженеры всё ещё восстанавливали связность и возвращали узлы в строй. Число стоек, узлов, кластеров и клиентов не публиковалось.

К 18:59 граница прошла между слоями. Региональная плоскость управления была, по словам DigitalOcean, полностью исправна. CPU Droplets, Managed Databases, Load Balancers, Block Storage и Spaces работали нормально. Создание, изменение размера и другие операции с Droplets снова выполнялись, плоскости управления DOKS были доступны. Это подтверждённое восстановление общих сервисов и управляющих функций.

Однако GPU-слой оставался в другом состоянии. GPU Droplets в MKC1 были офлайн или недоступны, GPU-воркеры DOKS могли оставаться NotReady, а основанные на GPU точки инференса — не отвечать. DigitalOcean намеревалась кратко наблюдать за плоскостью управления и затем закрыть региональный инцидент. Последующие персональные сведения для GPU-клиентов должны были поступать через Slack и электронную почту вместо страницы статуса.

В 19:34:54 статус изменился на resolved. Финальное сообщение снова подтвердило нормальную работу общей платформы и одновременно сказало, что GPU Droplets продолжают испытывать влияние, а команды восстанавливают все узлы. Поэтому 8 часов 24 минуты 48 секунд — это окно публичного управления инцидентом с меняющимся составом затронутых услуг. Оно не доказывает одинаковую продолжительность простоя всех продуктов или клиентов.

Регион был открыт всего за 15 дней до события. 4 августа DigitalOcean представила MKC1 как полностью жидкостно охлаждаемый дата-центр с GPU NVIDIA B300. На старте компания перечисляла вычисления, DOKS, базы данных, хранилища, сеть, App Platform, Functions и другие продукты. В материалах нет связи между причиной инцидента, охлаждением или моделью ускорителя. Но эпизод стал ранней публичной проверкой восстановления нового региона, где GPU занимают важное место в коммерческом предложении.

Устройство DOKS объясняет расхождение сигналов. DigitalOcean управляет плоскостью управления Kubernetes, а клиентские приложения работают на рабочих узлах. Доступная API возвращает возможность видеть и администрировать кластер, но не создаёт GPU-ёмкость на узле, который всё ещё NotReady. В документации есть автоматическое исправление рабочих узлов, однако функция находится в публичной предварительной версии, включается клиентом и зависит от правил, задержек, действий и лимитов параллельных замен. Нет данных, что пострадавшие клиенты её активировали.

Открытых сведений недостаточно для более сильных выводов. Фразы об установленной причине и совместной работе с площадкой не позволяют назвать электричество, охлаждение, сеть, оборудование, ПО или человека. Не опубликованы число клиентов, точное время полного возврата GPU, вывод о потере данных или целостности нагрузок и подробный план предотвращения повторения. Последующий зелёный индикатор компонента не восстанавливает эти исторические факты.

Оператору требуется несколько независимых проверок: доступность плоскости управления, состояние Ready у воркеров, выдача ускорителей, ответ точек инференса и метрики приложения. 19 августа они вернулись не одновременно. Регион достиг порога публичного закрытия, а более дефицитные GPU-ресурсы остались в отдельном канале восстановления для затронутых клиентов.

Источники