Résumé

  • Cloudflare a ouvert l'incident à 06 h 59 UTC le 19 août, appliqué un correctif à 07 h 06 et déclaré la résolution à 07 h 20. L'avis évoquait plusieurs clients potentiellement touchés par davantage d'erreurs de surcharge.
  • Seul le composant “Durable Objects” est passé en performances dégradées. Le site de Hong Kong, RealtimeKit et Realtime SFU sont restés opérationnels dans les données de statut, malgré un risque d'erreurs annoncé pour ces produits dépendants.

Le voyant de Hong Kong n'a jamais quitté le vert. Celui de “Durable Objects”, si. Durant le même incident, Cloudflare a aussi averti que des usages de RealtimeKit et de Realtime SFU pouvaient rencontrer davantage d'erreurs de surcharge, tout en laissant leurs composants au vert.

Cette superposition résume l'événement mieux que le mot « panne ». Selon la fiche de statut, l'enquête a commencé à 06 h 59 min 19 s UTC le 19 août. Cloudflare parlait d'un problème susceptible d'affecter plusieurs clients dans la région de Hong Kong. À 07 h 06, un correctif était appliqué et placé sous surveillance. À 07 h 20, l'incident était clos, soit une fenêtre enregistrée d'environ 21 minutes.

L'impact a été classé minor. Aucun bilan ne précise toutefois combien de clients ont reçu une erreur, quel taux de requêtes a échoué ni quelle opération a été touchée. La cause et la nature du correctif ne sont pas publiées. La rapidité de la résolution est donc établie ; l'explication technique ne l'est pas.

Pour comprendre la portée, il faut distinguer un lieu de présence d'un service avec état. Cloudflare présente un “Durable Object” comme une instance de Worker qui associe calcul et stockage privé, transactionnel et fortement cohérent. Son nom est unique à l'échelle mondiale. Plusieurs clients peuvent s'adresser à cette même instance afin de coordonner une salle de discussion, un document, une session ou un autre état partagé.

Chaque objet s'exécute dans un lieu et sur un seul fil, même si des millions d'objets différents peuvent être répartis dans le réseau. Cela simplifie l'ordre des opérations. Cela signifie aussi que l'état d'un objet donné ne peut pas être recréé par un simple détour vers n'importe quel point de présence disponible. Une région peut rester joignable alors que la primitive de coordination nécessaire à l'application renvoie des erreurs.

Les données de composant rendent cette différence visible. “Durable Objects” est passé de operational à degraded_performance. HKG, RealtimeKit et Realtime SFU sont restés operational. Le texte d'incident disait néanmoins que des clients des deux produits Realtime pouvaient être touchés. Un composant vert indiquait donc la disponibilité générale du périmètre suivi, pas la réussite de chaque chemin applicatif.

Le mot « surcharge » ne fournit pas à lui seul une cause. La documentation de dépannage recense plusieurs cas : trop de requêtes en file, trop de données en attente, une attente excessive ou un volume extrême vers le même objet sur une courte période. Cloudflare n'a pas dit lequel correspondait à Hong Kong. Elle n'a pas davantage attribué l'événement à l'architecture d'un client ou à un afflux particulier.

Cette réserve n'empêche pas une règle de conduite. La documentation sur les erreurs déconseille de relancer immédiatement une exception marquée .overloaded, car la répétition peut accentuer la charge. Il s'agit d'une consigne générale ; rien ne prouve que toutes les erreurs du 19 août portaient cet attribut. Une application doit donc classifier l'erreur avant de choisir entre nouvelle tentative progressive, rejet contrôlé ou mode dégradé.

RealtimeKit ajoute une autre dépendance à vérifier. Dans sa présentation de Realtime, Cloudflare indique que RealtimeKit fournit des SDK et API de voix et de vidéo au-dessus de Realtime SFU, chargé d'acheminer les flux. L'incident ne dit pas si le contrôle de réunion, la signalisation, la gestion des participants ou le média lui-même a échoué. Il ne permet pas d'affirmer qu'un appel a été interrompu ou un enregistrement perdu.

La preuve utile se trouve donc plus bas dans la pile. Les mesures “Durable Objects” peuvent être consultées par espace de noms et filtrées jusqu'à un identifiant ou un nom d'objet. En rapprochant ces données des horodatages 06 h 59–07 h 20, un client peut déterminer si l'erreur était générale, concentrée sur quelques objets ou visible seulement dans une étape métier.

Il faut enfin isoler cet épisode de la maintenance d'interconnexion HKG programmée plus tard le même jour. Les sources gelées ne publient aucun lien causal. Le partage d'un code de ville n'autorise aucune conclusion sur le site physique, le circuit, l'équipement ou le changement concerné.

Cloudflare a rétabli son service rapidement. Ce résultat ne rend pas interchangeable un composant de localisation et une dépendance avec état. La prochaine information décisive serait une analyse de cause reliant le mode de surcharge, le périmètre produit, les clients touchés et le correctif. En son absence, le fait solide est plus étroit : un service de coordination a été dégradé pendant 21 minutes sous un site resté vert.

Sources