Résumé

  • Un audit externe a conclu que Telstra n’avait pas considéré la synchronisation du réseau comme une capacité critique et a relevé des lacunes en matière de responsabilité, de supervision, d’expertise et de contrôles opérationnels
  • Telstra a transféré ses services vers son système stratégique de synchronisation et vérifie si d’autres fonctions réseau critiques présentent des faiblesses similaires

Les faits

Telstra a commencé à examiner d’autres fonctions réseau critiques après qu’une enquête externe sur sa panne de juillet a conclu que la synchronisation du réseau n’avait pas été gérée comme une capacité critique. Technology Audit Partners a confirmé que le système de synchronisation avait provoqué la perturbation et a relevé des responsabilités mal définies, une supervision de bout en bout limitée, une expertise spécialisée insuffisante ainsi que des faiblesses dans la gestion des changements, le contrôle des configurations, la documentation et la gestion des incidents, selon Telstra.

Telstra a indiqué avoir depuis transféré les services des anciens serveurs NTP vers son système stratégique de synchronisation sur les trois sites, ajouté des fonctions de surveillance et d’alerte et renforcé les tests en laboratoire avant les modifications du réseau. Un programme de remédiation à l’échelle de l’entreprise est en cours, tandis que l’opérateur examine également d’autres fonctions réseau critiques afin de détecter d’éventuelles lacunes similaires. Cet audit fait suite à la panne de juillet, qui a perturbé les services mobiles et fixes dans toute l’Australie et touché d’autres services dépendant du réseau de Telstra.

L’évaluation

La défaillance de juillet était technique, mais l’audit met en évidence un problème dans la manière dont la fonction de synchronisation était gérée avant toute panne. Telstra ne la considérait pas comme une capacité critique assortie d’une responsabilité claire de bout en bout et des contrôles qu’un tel statut exigerait. Comme la synchronisation prend en charge de nombreux éléments du réseau, des faiblesses dans sa maintenance ou sa supervision peuvent passer inaperçues jusqu’à ce qu’une modification les révèle.

Le transfert des services vers le système stratégique de synchronisation répond au problème immédiat. L’examen plus large est important, car Telstra cherche désormais à déterminer si d’autres fonctions réseau essentielles présentent des lacunes similaires en matière de responsabilité, de documentation, de surveillance ou de soutien spécialisé. Ce travail pourrait révéler des problèmes avant qu’une nouvelle modification courante ne les transforme en panne.

Pour les lecteurs de BTW, l’évolution importante concerne le périmètre. Telstra ne considère plus l’incident de juillet uniquement comme la défaillance d’un composant de synchronisation; l’entreprise s’en sert pour examiner la manière dont d’autres fonctions critiques sont classées, maintenues et attribuées à des responsables dans l’ensemble du réseau.

Points à surveiller

Il faudra observer si Telstra précise quelles autres fonctions réseau sont couvertes par l’examen et communique les changements apportés. La désignation de responsables, la mise à jour des documents de maintenance, de nouveaux dispositifs de surveillance, des tests en laboratoire et l’achèvement des migrations montreraient que le programme dépasse la défaillance initiale de synchronisation. La découverte de faiblesses similaires ailleurs indiquerait jusqu’où le problème s’étendait au-delà de l’incident de juillet.