Кратко

  • Внешняя проверка показала, что Telstra не считала синхронизацию времени в сети критически важной функцией, и выявила недостатки в распределении ответственности, надзоре, экспертизе и операционном контроле
  • Telstra перевела сервисы на свою целевую систему синхронизации и проверяет другие критически важные сетевые функции на наличие аналогичных недостатков

Факты

Telstra начала проверять другие критически важные сетевые функции после того, как внешнее расследование июльского сбоя установило: синхронизация времени в сети не управлялась как критически важная функция. По данным Telstra, Technology Audit Partners подтвердила, что причиной нарушения работы стала система синхронизации, и выявила неясное распределение ответственности, ограниченный сквозной надзор, нехватку профильных специалистов, а также недостатки в управлении изменениями, контроле конфигураций, документации и управлении инцидентами.

Telstra сообщила, что с тех пор перевела сервисы с прежних серверов NTP на свою целевую систему синхронизации на всех трёх площадках, добавила средства мониторинга и оповещения, а также расширила лабораторные испытания перед внесением изменений в сеть. Компания реализует общую программу устранения недостатков, одновременно проверяя другие критически важные сетевые функции на наличие аналогичных проблем. Проверка последовала за июльским сбоем, который нарушил работу мобильной и фиксированной связи по всей Австралии и затронул другие сервисы, зависевшие от сети Telstra.

Оценка

Июльский сбой имел техническую причину, однако результаты проверки указывают на проблему в управлении функцией синхронизации ещё до возникновения неисправности. Telstra не считала её критически важной функцией, требующей чёткой сквозной ответственности и соответствующих мер контроля. Поскольку синхронизация необходима для работы многих сетевых элементов, недостатки в её обслуживании или надзоре могут оставаться незамеченными, пока их не обнаружит очередное изменение.

Перевод сервисов на целевую систему синхронизации устраняет проблему в прежней среде. Более широкая проверка важна потому, что теперь Telstra выясняет, есть ли у других ключевых сетевых функций аналогичные недостатки в распределении ответственности, документации, мониторинге или поддержке профильных специалистов. Такая работа может выявить проблемы до того, как очередное плановое изменение приведёт к новому сбою.

Для читателей BTW главное изменение касается масштаба проверки. Telstra больше не рассматривает июльский инцидент исключительно как отказ компонента синхронизации: компания использует его, чтобы изучить, как другие критически важные функции классифицируются, обслуживаются и распределяются между ответственными подразделениями по всей сети.

За чем следить

Важно, назовёт ли Telstra другие сетевые функции, охваченные проверкой, и раскроет ли внесённые изменения. Назначение ответственных, обновление документации по обслуживанию, внедрение нового мониторинга, лабораторные испытания и завершённые миграции станут доказательствами того, что программа вышла за рамки устранения первоначального сбоя системы синхронизации. Обнаружение аналогичных недостатков в других областях покажет, насколько далеко проблема выходила за пределы июльского инцидента.