• Bei Cloudflare R2 traten im Osten Nordamerikas ab 21:10 UTC am 4. September bis in die frühen Stunden des 5. September vermehrt 503-Fehler auf
  • Anwendungen, die von R2 abhängen, können Nutzern Speicherfehler anzeigen, selbst wenn der Vorfall auf ein Produkt und eine Region begrenzt ist

Der Sachverhalt

Cloudflare erklärte einen Vorfall beim R2-Objektspeicher im Osten Nordamerikas am 5. September um 00:42 UTC für behoben. Der Vorfall begann am 4. September um 21:10 UTC, als Kunden in der Region eine erhöhte Zahl von HTTP-503-Fehlern verzeichneten. Dem Statusverlauf von Cloudflare zufolge ermittelten die Ingenieure die Ursache, nahmen eine Fehlerbehebung vor und überwachten den Dienst, bevor sie den Vorfall abschlossen.

Der Vorfall wurde für R2 im Osten Nordamerikas gemeldet und nicht als globaler Ausfall von Cloudflare. R2 ist der Objektspeicherdienst von Cloudflare und dient zur Speicherung von Dateien, Ressourcen und anderen Anwendungsdaten. Eine Anwendung, die auf Objekte angewiesen ist, die über den betroffenen Dienst gespeichert werden, kann daher Nutzern Fehler anzeigen, wenn der Zugriff auf diesen Speicher gestört ist.

Die Einschätzung

Der Vorfall war so weit begrenzt, dass er nach Produkt und Region beschrieben werden konnte. Anwendungen, die diesen R2-Dienst nutzten, konnten dennoch nicht ordnungsgemäß funktionieren, wenn sie gespeicherte Daten abrufen wollten. Für ein Anwendungsteam ist deshalb entscheidend, wo der Fehler auftritt: Ein 503-Fehler von R2 weist auf eine Speicheranfrage hin, die nicht abgeschlossen werden konnte; er belegt nicht, dass die gesamte Plattform von Cloudflare nicht verfügbar war.

Der nächste Diagnoseschritt setzt voraus, dass bekannt ist, welche Teile einer Anwendung in der betroffenen Region auf R2 angewiesen sind. Ein Dienst, der diese Objekte für eine kritische Funktion benötigt, kann unmittelbar beeinträchtigt sein, während ein anderer möglicherweise weiterläuft und nur ein Teil seiner Inhalte nicht verfügbar ist.

Aus der vorliegenden Berichterstattung gehen weder Ausfallzeiten auf Kundenebene noch Datenverluste hervor. Daher lässt sich keine Auswirkung belegen, die über die von Cloudflare gemeldeten vermehrten Fehler hinausgeht. Für Leser von BTW muss die Entscheidung über Ausfallsicherheit daher auf Ebene der jeweiligen Arbeitslast fallen. Teams müssen wissen, welche Anwendungsfunktionen von dem Speicherdienst abhängen, bevor sie entscheiden, wie stark diese Abhängigkeit abgesichert werden muss.

Worauf zu achten ist

Zu beobachten sind mögliche nachträgliche Erläuterungen von Cloudflare sowie weitere R2-Vorfälle im Osten Nordamerikas. Nähere Angaben zu Ursache und Wiederherstellung würden die Abgrenzung der Störung verdeutlichen und zeigen, ob sich dasselbe regionale Muster wiederholt. Berichte von Kunden über Zugriffsprobleme, die nach dem von Cloudflare genannten Behebungszeitpunkt anhielten, würden zudem helfen festzustellen, ob die Wiederherstellung über den in der Statusmeldung des Anbieters genannten Zeitpunkt hinaus andauerte.