• Le 6 septembre, F5 a mis fin à une dégradation du Distributed Cloud Global Log Receiver qui touchait un client depuis la veille
  • Le trafic client et les services Distributed Cloud Console sont restés opérationnels, tandis que F5 n’a pas précisé si les journaux concernés avaient été retardés, perdus ou récupérés par la suite

Les faits

F5 a résolu, le 6 septembre à 07 h 54 UTC, un incident touchant son Distributed Cloud Global Log Receiver. L’entreprise enquêtait depuis le 5 septembre sur des signalements de dégradation du service.

F5 a indiqué que l’impact était limité à un seul client, qu’elle a contacté directement. Elle a également indiqué que le trafic client n’avait pas été affecté et que les services Distributed Cloud Console étaient restés opérationnels. Le Global Log Receiver sert à recevoir des données de journalisation; le problème signalé concernait donc l’acheminement des journaux plutôt que le trafic applicatif sous-jacent.

Un outil tiers de suivi de l’état du service a relevé environ 12 heures et 50 minutes entre la détection et la résolution. Cette durée correspond à la fenêtre de suivi de l’incident et ne signifie pas que le trafic client a été indisponible pendant tout ce temps.

L’analyse

Pour le client touché, le problème ne portait pas sur l’acheminement du trafic applicatif via F5. Il concernait la réception des journaux utilisés pour observer et analyser ce qui se passait autour de ce trafic. Les applications pouvaient rester disponibles alors que les informations utilisées par les équipes de sécurité et d’exploitation étaient dégradées.

Le rétablissement ne consiste donc pas seulement à remettre le récepteur en ligne. Le client doit également savoir ce qu’il est advenu des journaux générés pendant l’incident: s’ils sont arrivés en retard, ont été perdus ou sont devenus disponibles après le rétablissement du service. La mise à jour de F5 sur l’état du service ne fournit pas ce niveau de détail; elle ne permet donc pas d’établir qu’il y a eu une perte définitive de données de journalisation.

Pour les lecteurs de BTW, se fier uniquement à la disponibilité du trafic aurait fait passer cet incident inaperçu. Les équipes qui utilisent ce service doivent surveiller séparément l’acheminement des journaux si ces enregistrements font partie de leurs enquêtes de sécurité ou de leurs contrôles opérationnels.

À surveiller

Il faudra surveiller les éventuelles précisions de F5 sur le sort des journaux générés pendant l’incident — arrivés en retard, perdus ou récupérés après le rétablissement du service — ainsi que la publication éventuelle de la cause profonde de l’incident. Toute nouvelle dégradation du Global Log Receiver aiderait également à déterminer s’il s’agissait d’un incident isolé touchant un client ou d’un problème de service récurrent.