Zusammenfassung

  • Cloudflare untersuchte ab 06:59 UTC am 19. August erhöhte Überlastungsfehler bei „Durable Objects“ und möglicherweise abhängigen Realtime-Produkten in Hongkong. Um 07:06 war eine Korrektur eingespielt, um 07:20 galt der Vorfall als behoben.
  • Nur „Durable Objects“ wechselte im Komponentenverlauf auf eingeschränkte Leistung. HKG, RealtimeKit und Realtime SFU blieben betriebsbereit, obwohl der Meldungstext mögliche Fehler für Nutzer dieser Produkte nannte.

Eine grüne Standortampel beantwortet eine breite Frage: Ist der Standort grundsätzlich erreichbar? Cloudflares Vorfall in Hongkong zeigte, dass eine zustandsbehaftete Produktfunktion darunter trotzdem scheitern kann.

Der offizielle Eintrag begann am 19. August um 06:59:19 UTC. Cloudflare untersuchte ein Problem, das möglicherweise mehrere Kunden in Hongkong betraf. Bei „Durable Objects“ sowie abhängigen Produkten wie RealtimeKit und Realtime SFU könnten vermehrt Überlastungsfehler auftreten. Um 07:06:33 war eine Korrektur implementiert; um 07:20:23 wurde der Vorfall geschlossen.

Damit dauerte das protokollierte Ereignis ungefähr 21 Minuten. Cloudflare stufte die Auswirkung als minor ein. Eine Ursache, die konkrete Korrektur, Kundenzahl, Fehlerrate oder betroffene Objekt-IDs veröffentlichte das Unternehmen nicht. Auch Datenverlust, abgebrochene Besprechungen oder ein Ausfall des gesamten Standorts sind nicht belegt.

Der Komponentenverlauf zieht die entscheidende Grenze. „Durable Objects“ wechselte von operational zu degraded_performance. Hongkong, RealtimeKit und Realtime SFU blieben jeweils operational. Gleichzeitig warnte der Meldungstext vor möglichen Fehlern in den Realtime-Produkten. Die Komponentenfarbe beschrieb also nicht jeden Aufrufpfad, sondern den breiteren Umfang des jeweiligen Statusobjekts.

„Durable Objects“ ist dafür besonders relevant. Laut Cloudflare-Dokumentation verbindet ein Objekt Rechenlogik mit privatem, transaktionalem und stark konsistentem Speicher. Es trägt einen weltweit eindeutigen Namen und koordiniert mehrere Clients, die denselben Zustand benötigen.

Ein einzelnes Objekt läuft an einem Ort und in einem Ausführungsthread. Viele verschiedene Objekte lassen sich über das Netz verteilen. Der Zustand eines bestimmten Objekts kann jedoch nicht wie eine zustandslose Anfrage beliebig zu einem anderen gesunden Edge-Standort geschickt werden. Genau seine eindeutige Reihenfolge und Konsistenz bilden den Vertrag des Dienstes.

Deshalb kann der Standort erreichbar bleiben, während eine Anwendung keine Sitzung, Sperre, Teilnehmerliste oder andere koordinierte Aktion abschließt. Der grüne HKG-Indikator widerlegt die Durable-Objects-Störung nicht. Er zeigt lediglich, dass der Vorfall enger als ein vollständiger Standortausfall war.

Auch „Überlastung“ ist noch keine Ursachenanalyse. Cloudflares Fehlerhilfe nennt zu viele wartende Anfragen, zu große wartende Datenmengen, zu lange Wartedauer und eine extreme Zahl von Aufrufen desselben Objekts in kurzer Zeit. Welcher Fall in Hongkong vorlag, ist unbekannt. Es gibt keinen Beleg, dass ein Kundendesign oder Kundenverkehr die Plattformstörung ausgelöst hat.

Für die Reaktion ist die Unterscheidung dennoch nützlich. Die Anleitung zur Fehlerbehandlung rät davon ab, mit .overloaded markierte Ausnahmen sofort erneut zu senden. Zusätzliche Versuche können Last und Fehlerrate erhöhen. Das ist allgemeine Produktanleitung und kein Nachweis für die genaue Kennzeichnung der Fehler vom 19. August. Anwendungen müssen das Signal erkennen, bevor sie Backoff, Ablehnung oder einen eingeschränkten Modus wählen.

RealtimeKit und Realtime SFU erweitern den zu prüfenden Pfad, ohne einen Medienausfall zu beweisen. Cloudflare beschreibt RealtimeKit als SDKs und APIs für Live-Audio und -Video auf Basis der Realtime SFU, die Medien weiterleitet. Der Vorfall sagt nicht, ob Besprechungserstellung, Teilnehmerstatus, Signalisierung, Track-Verwaltung oder Medienfluss betroffen waren.

Eigene Messwerte können diese Lücke verkleinern. Cloudflare stellt Durable-Objects-Analysen pro Namespace und Anfrage bereit; Ansichten lassen sich nach Objektname oder ID filtern. Fehler, Latenz und Geschäftsvorgänge für 06:59 bis 07:20 zusammenzuführen ist aussagekräftiger als eine Standortfarbe.

Der Vorfall darf außerdem nicht mit der für später am Tag geplanten HKG-Interconnect-Wartung verknüpft werden. Die eingefrorenen Quellen enthalten keinen Kausalzusammenhang. Gleicher Stadtcode und gleiches Datum beweisen weder gemeinsame Anlage noch Leitung, Gerät oder Änderung.

Cloudflare begrenzte das dokumentierte Ereignis durch eine schnelle Wiederherstellung. Für Kunden bleibt die Gestaltungsfrage: Welcher Betrieb ist zulässig, wenn der konsistente Koordinator nicht erreichbar ist? Mehr Objektpartitionen, begrenzte Wiederholungen, idempotente Schreibvorgänge oder ein Nur-Lese-Modus können helfen. Jede Option verändert jedoch die Semantik der Anwendung.

Die nächste belastbare Information wäre ein Ursachenbericht mit Überlastungsart, Produktgrenze und Reparatur. Bis dahin lautet der Befund präzise: Ein regionaler Zustandsdienst war rund 21 Minuten beeinträchtigt, während die breitere Standortanzeige grün blieb.

Quellen