Резюме
- Ofcom сообщил, что жители Шетландских островов потеряли мобильную и фиксированную связь примерно на 16 часов в октябре 2022 года после повреждения южного подводного волоконно-оптического соединения, в то время как вторичное соединение уже было недоступно из-за повреждения, полученного неделей ранее. [10]
- Ofcom отметил, что унаследованный низкоскоростной микроволновый транспорт в значительной мере сохранил доступность голосовой связи ТфОП (PSTN). Также сообщается, что временное восстановление было достигнуто за счёт увеличения оптической мощности на источнике, а ремонт как основного, так и резервного соединений занял около десяти дней. [10]
- Переписка Scottish Government фиксирует периодические проблемы на резервном соединении с 14 октября и описывает повреждение основного соединения как случайное, нанесённое рыболовным судном, зарегистрированным в Великобритании, вскоре после полуночи 20 октября. Публичные материалы не подтверждают версию о диверсии. [4][5][11]
- Заявления Faroese Telecom, опубликованные в то время, сообщали, что технические специалисты активировали запасную или неиспользуемую волоконно-оптическую ёмкость в повреждённом кабеле и восстановили значительную часть сервисов, передававшихся по оптоволокну BT. Это свидетельство конкретного действия по восстановлению, а не доказательство того, что все сервисы и провайдеры восстановились одновременно. [15][20]
- Shetland Islands Council сообщил, что часть клиентов оставалась без связи, поскольку их провайдеры не имели резервных соединений и не могли получить доступ к неповреждённому оптоволокну. Совет также сообщил о проблемах, затронувших некоторые службы телемедицинского ухода и общественные системы тревожной сигнализации. [13]
- Police Scotland направила сотрудников и транспорт, чтобы сохранить доступ к экстренным службам, пока обычная связь была нарушена. [12]
- Вопрос подотчётности не в том, существовали ли два физических кабеля. Он в том, кто контролировал практически доступную резервную ёмкость, доступ провайдеров, оптический и микроволновый резерв, аварийные меры, очерёдность ремонта и доказательства, использованные для объявления о восстановлении сервисов.
- Полные контракты провайдеров, политики маршрутизации, оптические бюджеты, число клиентов и данные о потерях не являются публичными. Доказательства поддерживают анализ контроля, а не обвинения в адрес отдельных провайдеров.
- Ближайшее сравнение — обрыв кабеля у Тонга в 2022 году, но эти случаи различны. В случае Тонга речь шла о единственном международном маршруте, вулканическом повреждении морского дна и длительной логистике ремонта. Шетландские острова выявили разрыв между номинально разнесёнными маршрутами и доступом конкретных сервисов к сохранившейся ёмкости.
Крупная авария может существовать внутри резервированной схемы
Резервирование — одно из самых успокаивающих слов в инфраструктуре.
Оно предполагает, что отказ одного компонента не приведёт к отказу сервиса. Ожидается, что второй кабель, маршрутизатор, фидер питания, дата-центр или плоскость управления возьмут нагрузку на себя. Это слово часто появляется в архитектурных схемах, закупочных документах, отчётах регулятора и реестрах рисков руководства задолго до того, как кто-то увидит, работает ли оно.
Авария на Шетландских островах в октябре 2022 года показывает, почему установленное резервирование и практически пригодное резервирование следует считать разными фактами.
Острова были связаны подводными оптоволоконными маршрутами, идущими на юг через Оркнейские острова к материковой Шотландии и на север к Фарерским островам. Публичные материалы описывают один как основной маршрут, а другой — как резервный или вторичный. За неделю до 20 октября северное соединение уже было повреждено. Вскоре после полуночи 20 октября было повреждено южное соединение. Позднее Ofcom охарактеризовал результат как потерю мобильной и фиксированной связи примерно на 16 часов. [4][10]
На первый взгляд событие можно описать как невезение: две физические неисправности в течение нескольких дней. Повреждение, как сообщается, было случайным. В публичных материалах упоминается рыболовное судно. Ремонт кабеля требует судов, погодных окон, специализированных бригад и физического доступа к местам повреждения. Ни один из этих фактов не является тривиальным. [4][11][16]
Но невезение не отвечает на операционный вопрос.
Почему система с двумя маршрутами вызвала столь масштабные нарушения? Почему одни сервисы вернулись быстро, а часть клиентов оставалась затронутой большую часть следующей недели? Почему унаследованная голосовая связь сохранила доступность лучше, чем сервисы, зависящие от передачи данных? Почему один набор трафика мог использовать восстановленную или резервную ёмкость, а другой — нет?
Эти вопросы уводят анализ от существования стального троса, стекла и берегового оборудования. Они направляют его к механизмам контроля, превращающим инфраструктуру в сервис:
- доступность маршрута;
- оптическая мощность и запас;
- пригодные для использования пары волокон;
- зарезервированная и запасная ёмкость;
- конфигурация коммутации и маршрутизации;
- оптовый доступ;
- соглашения розничных провайдеров;
- резервный транспорт;
- планы действий в чрезвычайных ситуациях;
- приоритет ремонта;
- мониторинг сервисов;
- доказательства восстановления.
Второй путь может физически существовать, но быть недоступным, потому что уже повреждён. Он может быть исправен, но не иметь достаточной ёмкости. Ёмкость может существовать без договорного или технического пути для конкретного сервиса. Провайдер может иметь маршрут на бумаге, но не проверять состояние аварийного переключения. Низкоскоростной резерв может сохранить голосовую связь, в то время как широкополосный доступ остаётся недоступным. Оператор может восстановить свет в волокнах, не доказав, что восстановился каждый нижестоящий сервис.
Материалы по Шетландским островам содержат примеры нескольких из этих условий. Именно это делает случай делом о подотчётности сетевой инфраструктуры, а не общей историей об обрыве кабеля.
Две неисправности необходимо рассматривать отдельно
Для этого события нужны две временные шкалы.
Переписка Scottish Government сообщает, что резервный кабель испытывал периодические проблемы с 14 октября и что Faroese Telecom направила людей для работы над ним. Второе событие произошло вскоре после полуночи 20 октября, когда был повреждён основной кабель. В переписке причиной названо случайное повреждение рыболовным судном, зарегистрированным в Великобритании, и сказано, что событие затронуло почти все сервисы, передававшиеся по этому кабелю. [4]
Более поздний отчёт Ofcom использует несколько иной операционный язык. В нём говорится, что вторичное оптоволоконное соединение уже было недоступно из-за повреждения, полученного на предыдущей неделе. Затем южный оптоволоконный кабель потерял свет. [10]
Эти описания не следует сводить к утверждению, что два кабеля были одновременно чисто перерезаны.
Публичные материалы различают периодические проблемы, недоступность, эффекты в волокнах, потерю света и ремонт кабеля. Сообщалось, что управляющий директор Faroese Telecom сказал, что более поздний обрыв затронул волокна, но не перерезал весь кабель. Местные сообщения указывают, что неисправность находилась в нескольких километрах от Шетландских островов, и описывают работу ремонтного судна более чем в одном месте. [15][16][18]
Это различие важно по трём причинам.
Во-первых, физический механизм влияет на варианты восстановления. Полный обрыв, повреждённая пара волокон, проблема с усилителем, проблема с питанием и сниженный оптический запас — это не одна и та же неисправность. Они могут допускать разные временные меры.
Во-вторых, описание влияет на распределение ответственности. Владелец кабеля может контролировать ремонт и оптическое восстановление. Оператор связи может контролировать размещение трафика. Розничный провайдер может зависеть от оптового пути. Государственный орган может контролировать экстренное реагирование. Присвоение всему событию одной метки может скрыть эти границы.
В-третьих, различие предотвращает ретроспективное преувеличение. Инцидент был серьёзным и без утверждений, что каждый кабель был полностью перерезан или каждый сервис полностью недоступен десять дней. Показатель Ofcom примерно в 16 часов описывает основной период потери мобильной и фиксированной связи. Десятидневный период описывает работы на обоих оптоволоконных соединениях до окончательного восстановления. Некоторые остаточные проблемы сервисов продолжались между этими точками. [10][13][18]
Поэтому подотчётная хронология должна разделять как минимум пять состояний:
- На северном или вторичном маршруте возникают проблемы.
- Начинаются ремонтные работы, пока южный маршрут ещё несёт трафик.
- Южный маршрут повреждён, за чем следует широкая потеря сервисов.
- Временные оптические меры и меры по ёмкости восстанавливают значительную часть трафика.
- Остаточные неисправности у отдельных провайдеров продолжаются до завершения постоянного ремонта.
Такая последовательность полезнее одной длительности аварии, потому что каждое состояние выявляет разные механизмы контроля и ответственных за решения.
Физическое разнообразие не равно разнообразию сервисов
Устойчивость сети часто измеряют не на том уровне.
На физическом уровне у Шетландских островов было более одного направления для оптоволоконной связи. Один маршрут шёл к Оркнейским островам и материковой Шотландии. Другой — к Фарерским островам. География выглядит разнообразной.
Однако на уровне сервисов клиент покупает не абстрактное направление по морскому дну. Клиент покупает широкополосный, мобильный, голосовой или институциональный сервис. Этот сервис проходит через цепочку оборудования доступа, локальной агрегации, оптового транспорта, маршрутизации провайдера, аутентификации, ядра систем и вышестоящего взаимодействия. Каждое звено этой цепочки нуждается в работающей альтернативе, если сервис должен пережить повреждение кабеля.
Обновление Совета от 28 октября необычайно важно, поскольку оно прямо называет проблему на уровне сервисов. В нём сказано, что пользователи, оставшиеся без интернета, обслуживались компаниями, у которых не было резервных соединений. Эти провайдеры не могли получить доступ к неповреждённому оптоволокну и зависели от ремонта. [13]
Заявление не раскрывает каждый контракт или таблицу маршрутизации. Оно не доказывает, почему каждому провайдеру не хватало доступа. Оно не показывает, было ли ограничение коммерческим, техническим, историческим или их сочетанием. Его не следует превращать в широкое утверждение, что названные компании сознательно отказались от резервирования.
Что оно доказывает, так это то, что альтернативная физическая ёмкость не преобразовалась автоматически в альтернативный сервис для всех клиентов.
Это повторяющийся паттерн отказов инфраструктуры.
Дата-центр может иметь два фидера питания, которые используют общую вышестоящую подстанцию. Облачное приложение может работать в двух зонах доступности, но зависеть от одной плоскости управления идентификацией. Мобильный оператор может иметь резервный транспорт, в то время как оба маршрута заканчиваются на одном маршрутизаторе. Реестр может иметь несколько серверов имён, которые получают одну и ту же повреждённую зону. Остров может иметь два кабельных направления, в то время как сервис провайдера достижим только по одному операционному или коммерческому пути.
В каждом случае подсчёт компонентов завышает устойчивость. Правильный вопрос — являются ли домены отказа независимыми вплоть до самого сервиса.
Для Шетландских островов это означает проверку:
- были ли северный и южный пути физически независимы в местах неисправности;
- избегали ли береговые и наземные сегменты общих точек;
- было ли достаточно ёмкости на альтернативном пути;
- были ли провайдеры авторизованы и настроены для его использования;
- могло ли аварийное переключение произойти автоматически;
- были ли процедуры ручной перемаршрутизации актуальными;
- оставались ли достижимыми зависимости сервисов, такие как DNS, аутентификация и управление;
- имели ли приоритет экстренный и публичный трафик;
- можно ли измерять клиентов по восстановленному сервису, а не только по восстановленному свету.
Публичные материалы отвечают на часть этих вопросов и оставляют другие открытыми. Эти пробелы в доказательствах сами по себе являются частью подотчётности и должны оставаться явными.
Увеличение оптической мощности стало механизмом восстановления
Отчёт Ofcom содержит техническую деталь, которая меняет историю.
В нём говорится, что южный оптоволоконный кабель потерял свет и что временное восстановление было достигнуто за счёт увеличения мощности на источнике. [10]
Оптоволоконные системы зависят от бюджета линии. Сигнал, запущенный в волокно, теряет мощность по мере прохождения через кабель, ретрансляторы, разъёмы и другие компоненты. Приёмнику нужно достаточно сигнала, чтобы надёжно различать данные. Повреждение может увеличить потери, не разрушая каждое волокно. Если у оставшегося пути достаточно запаса, изменение условий запуска может временно восстановить пригодный сигнал.
Публичный отчёт не раскрывает точную оптическую конструкцию, уровни мощности, пары волокон или инженерные пороги. Было бы ошибкой восстанавливать эти детали из общих принципов. Тем не менее разумно определить поверхность контроля.
Кто-то должен был:
- обнаружить, что проблема была потерей света;
- определить, какие волокна или сервисы остались восстанавливаемыми;
- оценить, было ли дополнительное повышение мощности безопасным и полезным;
- санкционировать изменение;
- отслеживать ошибки и стабильность;
- решить, какой трафик может вернуться;
- поддерживать ход постоянного ремонта.
Это не то же самое, что владение вторым маршрутом.
Оптическое восстановление также создаёт требование к доказательствам. «Свет восстановлен» — необходимый сетевой факт, но это не то же самое, что «клиентский сервис восстановлен». Волокно может пропускать сигнал, в то время как маршрутизация, аутентификация, ёмкость или нижестоящие пути провайдера остаются нарушенными. Поэтому отчёт о восстановлении должен связывать физические измерения с проверками сервиса.
Подотчётный отчёт о восстановлении должен разделять:
- оптическую непрерывность;
- стабильность канального уровня;
- маршрутизируемую достижимость;
- передачу провайдеру;
- установление широкополосной сессии;
- достижимость мобильного транспорта и ядра;
- голосовую связь;
- экстренные вызовы;
- доступ к публичным сервисным приложениям;
- наблюдаемую клиентом доступность.
Инцидент на Шетландских островах показывает, почему такой многоуровневый подход важен. Значительная часть сервисов вернулась 20 октября, но Совет всё ещё предупреждал о проблемах с интернетом и телемедицинским уходом 28 октября. [13]
Временный инженерный успех и полное восстановление сервиса не были одной и той же вехой.
Запасное оптоволокно имело значение, поскольку его можно было активировать
Современные местные сообщения добавляют ещё один механизм восстановления.
Shetland News сообщила, что Faroese Telecom активировала запасную и неиспользуемую волоконно-оптическую ёмкость в повреждённом кабеле. В сообщении говорилось, что эта ёмкость была зарезервирована для последующего использования и что её активация помогла восстановить сервисы, передававшиеся по оптоволокну BT. Управляющий директор оператора сказал, что неисправность затронула волокна, не перерезав весь кабель, и что технические специалисты восстановили сервисы в максимально возможной степени. [15]
Эта формулировка является атрибутированным сообщением, а не инженерным приложением Ofcom. Её следует использовать с соответствующим уровнем уверенности. Даже в этом случае она демонстрирует важный принцип: запасная инфраструктура имеет ценность только тогда, когда ответственные лица могут активировать её во время инцидента.
Запасное оптоволокно может существовать в нескольких формах. Кабель может содержать незажжённые волокна, неиспользуемую ёмкость на зажжённых парах или ёмкость, зарезервированную для роста. Превращение этого резерва в сервис может потребовать оборудования, конфигурации, прав использования, совместимых интерфейсов и операционной координации.
Вопросы подотчётности практичны:
- Была ли запасная ёмкость инвентаризирована?
- Знали ли операторы её состояние?
- Была ли она подключена к оборудованию, которое можно использовать при неисправности?
- Были ли процедуры активации проверены?
- Кто имел полномочия выделять её?
- Какие сервисы имели приоритет?
- Могли ли нижестоящие провайдеры её достичь?
- Было ли достаточно запаса для устойчивой работы?
- Какой мониторинг показал, что временный путь стабилен?
Инцидент показывает, что по крайней мере часть зарезервированной ёмкости можно было превратить в реальное восстановление. Он также показывает, что это превращение не покрыло каждый нижестоящий сервис.
Это более полезный урок, чем «стройте больше кабелей». Больше физических активов может снизить риск, но кабель, который нельзя достичь, переключить, запитать, законтрактовать или эксплуатировать при неисправности, — это дорогая схема. Инвестиции в устойчивость требуют эксплуатационных приёмочных испытаний.
Для каждого альтернативного пути провайдер должен иметь возможность показать:
- сервисы, сопоставленные с этим путём;
- ёмкость, доступную при отказе;
- триггер аварийного переключения;
- используемые команды или автоматизацию;
- лиц, уполномоченных действовать;
- зависимости, остающиеся за пределами пути;
- результаты тестов;
- цель восстановления;
- остаточный риск.
Без таких доказательств запасная ёмкость — это возможность, а не механизм контроля.
Низкоскоростная микроволновая связь сохранила иной тип непрерывности
Ofcom говорит, что наземные линии ТфОП для голосовой связи оставались в основном доступными благодаря унаследованному низкоскоростному микроволновому транспорту. [10]
Эту фразу не следует читать как доказательство того, что все наземные линии работали или что экстренная связь не пострадала. Оперативные сводки Scottish Government описывали широкую потерю наземной, интернет- и мобильной связи, а Police Scotland всё же развернула физическое присутствие для сохранения доступа к экстренным службам. [4][12]
Эти две записи могут сосуществовать.
Унаследованная микроволновая связь могла сохранить ограниченный голосовой путь, в то время как высокоскоростные сервисы отказали. Доступность может различаться по АТС, провайдеру, сервису, месту и времени. Низкоскоростной канал, недостаточный для обычного интернет-трафика, всё же может нести часть голосового трафика. Напротив, клиент, полагающийся на цифровой или специфичный для провайдера сервис, может не получить выгоды от унаследованного пути.
Это напоминание о том, что резерв должен проектироваться вокруг минимально жизнеспособных функций, а не только обычной ёмкости.
Во время серьёзного сбоя связи приоритеты могут включать:
- экстренные вызовы;
- координацию между полицией, пожарной службой, скорой помощью и береговой охраной;
- связь больниц и органов здравоохранения;
- тревожные сигналы телемедицинского ухода;
- публичные предупреждения;
- критически важные правительственные контакты;
- критические платёжные и логистические функции;
- управление ремонтными бригадами.
Резервный путь может быть ценным, даже если он не воспроизводит обычный широкополосный доступ. Инженерная и управленческая задача состоит в том, чтобы определить, какие сервисы он должен поддерживать, и доказать, что они могут его использовать.
Инцидент на Шетландских островах также показывает опасность отношения к старой инфраструктуре как к случайной устойчивости. Если унаследованный микроволновый путь выполняет функцию безопасности, его роль должна быть задокументирована, поддерживаться и тестироваться. Если его планируется вывести из эксплуатации, архитектура замены должна иметь эквивалентный или лучший путь отказа до вывода из эксплуатации.
В противном случае модернизация может удалить скрытый слой непрерывности.
Унаследованные системы не следует романтизировать. Низкая пропускная способность, ограниченное покрытие и стареющее оборудование создают собственные риски. Подотчётный вывод уже: ценность резерва определяется сервисом, который он может сохранить, а не тем, старый он или новый.
Доступ к экстренным службам превратил восстановление сети в общественную обязанность
Сбои связи становятся событиями общественной безопасности, когда люди не могут надёжно дозвониться до экстренных организаций.
Police Scotland сообщила, что сотрудники и транспорт были перемещены в этот район, чтобы обеспечить доступ населения к экстренным службам. После того как связь вернулась в норму, эти ресурсы были отозваны. [12]
Современные сообщения описывали совет попробовать набрать 999 со стационарного или мобильного телефона, а если это не удастся — остановить экстренный автомобиль или обратиться в отделение полиции, больницу, пожарную или скорую помощь. Дополнительные патрули и физический экстренный пункт использовались как замена обычной достижимости. [19]
Эти обходные меры важны, потому что они показывают, какой именно сервис защищался на самом деле.
Экстренный номер — это не просто функция телефона. Он зависит от:
- доступности сети доступа;
- маршрутизации вызовов;
- определения местоположения звонящего, где это технически доступно;
- стыковки с экстренными организациями;
- электропитания на стороне клиента и сетевых объектах;
- знания населением альтернатив;
- персонала и физической достижимости при сбое связи.
Общие условия Ofcom описывают требования, направленные на широкую доступность, бесперебойный доступ к экстренным организациям и меры по предоставлению или быстрому восстановлению во время чрезвычайной ситуации. Точные регуляторные обязанности, применимые к провайдеру и событию, требуют правового анализа, и текущее консолидированное руководство не следует применять задним числом без осторожности. Тем не менее это показывает, почему доступ к экстренным службам рассматривается как нечто большее, чем обычный показатель клиентского опыта. [8]
Реагирование на Шетландских островах следует оценивать на двух уровнях.
Первый — предотвращение сетевых проблем и восстановление. Были ли пути экстренных вызовов диверсифицированы? Работал ли оставшийся голосовой транспорт? Могли ли мобильные вызовы достичь экстренной сети? Имели ли провайдеры проверенные соглашения с экстренными организациями?
Второй — гражданская готовность. Когда достижимость сети стала неопределённой, установили ли власти видимые альтернативы, переместили ли ресурсы, проверили ли уязвимых людей и общались ли по каналам, которые ещё работали?
Полиция и местные власти контролировали второй уровень. Они не контролировали состояние кабеля или оптовую маршрутизацию. Их ответные действия снизили вред, но их не следует использовать для оправдания слабостей сетевого уровня.
Хороший экстренный обходной путь — это доказательство устойчивости. Это не доказательство того, что исходный сервис достиг своей цели доступности.
Телемедицинский уход выявил зависимость ниже уровня приложения
Shetland Islands Council сообщил о проблемах, затронувших некоторые службы телемедицинского ухода и общественные системы сигнализации, включая услуги, предоставляемые по аналоговым наземным линиям. Сотрудники связывались с клиентами и просили родственников и друзей проверить пожилых или уязвимых родных. [13]
Телемедицинский уход часто обсуждают как устройство или приложение социальной помощи. Во время аварии становятся видны его сетевые зависимости.
Кулон или домашняя сигнализация могут казаться пользователю простыми. За ними стоит цепочка:
- электропитание в помещении;
- блок сигнализации;
- локальная проводка или радиосвязь;
- путь доступа через наземную линию, мобильную связь или интернет;
- АТС и транспорт;
- центр мониторинга;
- процесс реагирования с участием человека.
Устройство может быть исправным, пока путь недоступен. Сеть может быть частично восстановлена, пока конкретная сигнализация всё ещё отказывает. Провайдер может сообщать о широком восстановлении сервиса, пока уязвимый пользователь остаётся изолированным.
Поэтому восстановление сервиса следует измерять по критической функции, а не только по совокупному трафику.
Обновление Совета не говорит, что отказала каждая сигнализация. Оно говорит, что некоторые сервисы пострадали, и описывает ручное реагирование для обеспечения благополучия. Эта граница важна, потому что сигнал риска не должен раздуваться до неподтверждённого заявления о вреде.
Подтверждённый вывод состоит в том, что непрерывность телекоммуникаций — часть непрерывности ухода. Операторам и государственным органам нужна общая карта зависимостей, которая определяет:
- какие типы сигнализаций используют какие технологии доступа;
- от каких провайдерских и оптовых путей они зависят;
- какие допущения о батареях или питании применяются;
- как обнаруживается отказ;
- кто получает предупреждение при отказе канала связи;
- какой ручной процесс обеспечения благополучия начинается;
- как восстановление проверяется на устройстве.
Опыт Шетландских островов превратил абстрактную сетевую аварию в конкретный вопрос: мог ли уязвимый человек всё ещё позвать на помощь?
Этот вопрос должен быть частью проектирования инфраструктуры до того, как кабель оборвётся.
Различия в результатах у провайдеров — это доказательство, а не повод для спекуляций
Остаточные различия в сервисах — одна из самых показательных частей события.
Совет сообщил, что часть пострадавших пользователей обслуживалась компаниями без резервных соединений и не могла получить доступ к неповреждённому оптоволокну. Позднее местные сообщения описывали, что одни провайдеры перенаправляли трафик, а другие оставались недоступны. [13][18]
Заманчиво превратить эту запись в рейтинг ответственных и безответственных провайдеров. Доказательства не поддерживают такой простой вывод.
Публичные источники не раскрывают:
- каждый оптовый контракт;
- каждый маршрут, купленный каждым розничным провайдером;
- пределы ёмкости на альтернативных путях;
- точное состояние оборудования каждого провайдера;
- какие клиенты использовали какую инфраструктуру;
- потерпела ли попытка аварийного переключения неудачу;
- был ли маршрут технически возможен, но коммерчески недоступен;
- какие целевые показатели уровня обслуживания применялись;
- какую информацию провайдеры получали во время ремонта.
Провайдер может не иметь альтернативы, потому что не купил её. Он может зависеть от оптовика, у которого её нет. Альтернатива может существовать, но иметь недостаточную ёмкость. Сервис может разделять локальный домен отказа, который не переживает ни одно направление. Ручной процесс может быть слишком медленным. Публичная отчётность не может разрешить все эти возможности.
Подотчётный подход — требовать доказательств.
Каждый провайдер, продававший услуги на географически ограниченном рынке, должен иметь возможность заявить на соответствующем уровне безопасности:
- домены отказа в его пути доступа и транспорта;
- альтернативный маршрут, доступный при отказе одного подводного сегмента;
- зарезервированную на этом маршруте ёмкость;
- условия, запускающие аварийное переключение;
- самый последний сквозной тест;
- сервисы, которые будут деградировать или останутся недоступными;
- цель восстановления;
- план информирования клиентов и государственных органов.
Это не требование публиковать чувствительную топологию. Это требование доказать, что слово «устойчивый» привязано к операционному механизму контроля.
Заявление Совета ценно именно потому, что оно сообщает о наблюдаемом поведении сервисов. Некоторые пользователи не могли использовать неповреждённое оптоволокно. Этот факт должен стимулировать целенаправленное расследование причин, не предполагая заранее ответа.
Очерёдность ремонта распределяла непрерывность
Физический ремонт кабеля — операция с ограничениями.
Необходимо локализовать неисправность. Должно быть доступно подходящее судно и специализированная команда. Погодные и морские условия должны позволять работу. Кабель, возможно, придётся поднять, разрезать, срастить, протестировать и вернуть на морское дно. Если повреждено более одного участка, судно не обязательно может отремонтировать оба одновременно.
Местные сообщения говорили, что ремонтное судно завершило работу на другом участке к западу от Шетландских островов, прежде чем перейти к неисправности к востоку от островов. О полном восстановлении широкополосного доступа сообщалось после завершения более позднего ремонта 30 октября. [18]
Эта последовательность означает, что порядок ремонта также является решением о распределении.
Операторам нужны критерии для решения:
- какая неисправность создаёт наибольший риск для сервиса;
- какой ремонт физически возможен раньше;
- достаточно ли стабилен временный путь, чтобы ждать;
- какой маршрут восстанавливает наиболее критичные сервисы;
- создаст ли другая неисправность полную изоляцию;
- как долго резервная ёмкость может нести нагрузку;
- доступны ли оборудование и запасные части;
- какое погодное окно ожидается.
Публичные материалы не показывают полный журнал решений. Они показывают, что ремонт обоих соединений — основного и резервного — занял около десяти дней и что в течение этого периода использовались временные меры. [10]
Подотчётность не требует делать вид, что подводный ремонт может быть мгновенным. Она требует доказательств того, что оператор понимал изменение риска и принимал наилучшие контролируемые решения.
Такие доказательства могут включать:
- уверенность в локализации неисправности;
- оценки влияния на сервис;
- доступность судна и команды;
- состояние ёмкости маршрута;
- погодные ограничения;
- стабильность временного восстановления;
- требования экстренных служб;
- обоснование порядка ремонта;
- обновлённые оценки завершения;
- оптические и сервисные тесты после ремонта.
Неопределённость должна быть видимой. Прогноз, основанный на прибытии судна и погоде, не является обещанием. Публичное обновление статуса должно различать известное состояние неисправности, текущий обходной путь, предполагаемое время ремонта и остающийся риск.
Событие на Шетландских островах показывает, почему готовность к ремонту — часть проектирования сети. Маршрут не является полностью устойчивым, если оператор не может локализовать неисправности, получить судно, получить запасные части, скоординировать береговые пункты и сообщать реалистичные доказательства восстановления.
Практический контроль был распределён
В событии участвовало несколько организаций, но контроль не был распределён равномерно.
Владелец и оператор кабеля
Faroese Telecom и система SHEFA находились ближе всего к физическому обнаружению неисправностей, оптическому состоянию, запасному оптоволокну и постоянному ремонту. Приписываемые оператору заявления описывают временные технические действия и работу кабельного судна. Это даёт оператору кабеля значительный контроль над физическим восстановлением.
Это не даёт оператору контроля над проектированием сервисов каждого розничного клиента или каждым нижестоящим контрактом.
Оптовые и розничные провайдеры связи
Провайдеры контролировали или зависели от контроля других в отношении размещения трафика, доступа к альтернативным маршрутам, ёмкости, информирования клиентов и восстановления сервисов. Отчёт Совета о различиях в непрерывности у провайдеров делает этот уровень центральным.
Публичные материалы не показывают, какая часть цепочки каждого провайдера приняла решающее решение. Ответственность должна следовать за подтверждёнными возможностями, а не за заметностью бренда.
Ofcom и правительство
Ofcom контролировал регуляторную отчётность и более широкие рамки устойчивости, а не устранение инцидента. Его отчёт Connected Nations даёт публичную техническую базу. Правительственные группы по устойчивости координировали информацию и экстренное реагирование. Регуляторный и политический вопрос состоит в том, требовалось ли от провайдеров понимать и снижать предсказуемый общий отказ.
Усиленные рамки безопасности и устойчивости телекоммуникаций вступили в силу в октябре 2022 года. Ofcom описал обязанности по выявлению рисков, снижению последствий компрометации безопасности и принятию мер по исправлению. Физическая авария кабеля не является автоматически компрометацией безопасности в рамках каждого правового положения, поэтому эти рамки следует использовать как контекст устойчивости, а не как неподтверждённый вывод о правоприменении. [6][7]
Полиция, совет, здравоохранение и экстренные службы
Государственные органы контролировали локальные меры смягчения: патрули, физические точки доступа, контакты для обеспечения благополучия и координацию сервисов. Они поглощали последствия, созданные сбоем связи, но не контролировали кабель или маршрутизацию провайдеров.
Их работа — свидетельство переноса общественных издержек. Когда обычная телекоммуникация отказывает, государственные организации предоставляют людей, транспорт и ручные проверки, чтобы воссоздать часть сервиса.
Клиенты и уязвимые пользователи
Клиенты располагали доказательствами отказа сервиса и личных последствий. Они, как правило, не контролировали разнообразие маршрутов, ремонт или альтернативную ёмкость. Совет использовать другое устройство, переместиться или проверить соседа может снизить вред, но не переносит инфраструктурную ответственность на пользователя.
Эта карта контроля позволяет избежать двух ошибок.
Первая — винить субъекта, ближайшего к физическому повреждению, за все нижестоящие последствия. Вторая — считать распределённую ответственность отсутствием ответственности. Разные стороны контролировали разные функции предотвращения, непрерывности, восстановления и доказательств.
Подотчётность не требует доказательства злого умысла
Публичные материалы описывают случайное повреждение в результате рыболовной деятельности. [4][11][16]
Этот вывод сужает событие. Доступные доказательства не поддерживают представление аварии как саботажа, геополитической атаки или преднамеренного нарушения.
Это не снимает подотчётность.
Инфраструктура часто повреждается по обычным причинам: земляные работы, якоря, траловое снаряжение, погода, неудачное обслуживание, потеря питания и ошибки конфигурации. Система устойчивости существует потому, что эти причины предсказуемы, даже если их точное время — нет.
Поэтому вопросы подотчётности таковы:
- Был ли маршрут защищён и отслеживался надлежащим образом?
- Был ли второй маршрут действительно независимым?
- Имели ли сервисы практически пригодный доступ к нему?
- Было ли проверено аварийное переключение?
- Была ли достаточной резервная ёмкость?
- Могли ли ответственные восстановить повреждённые волокна?
- Были ли актуальны экстренные меры?
- Был ли ремонт готов?
- Сообщили ли общественности, что оставалось недоступным?
- Снизила ли работа после инцидента вероятность повторения?
Ни один из этих вопросов не зависит от злого умысла.
Умысел важен для правовой атрибуции и атрибуции безопасности. Контроль важен для операционной подотчётности.
То же различие защищает от несправедливых обвинений. Владелец кабеля не может предотвратить контакт каждого рыболовного судна с кабелем. Розничный провайдер не может отремонтировать подводное оптоволокно, которым не владеет. Местный совет не может перенастроить транспорт оператора связи. Справедливое расследование спрашивает, что каждая сторона реально могла сделать до, во время и после события.
Оператор может нести ответственность за маркировку маршрута, мониторинг, локализацию неисправностей и готовность к ремонту. Оператор связи может нести ответственность за альтернативную ёмкость и проверенное аварийное переключение. Регулятор может нести ответственность за ожидания устойчивости и доказательства. Государственные органы могут нести ответственность за экстренные планы.
Это сильнее нарратива о вине, поскольку выявляет механизмы контроля, которые можно изменить.
Показатели воздействия требуют дисциплины по уровням
Инцидент породил несколько разных мер времени и воздействия.
Примерно 16 часов у Ofcom относятся к основному периоду, в течение которого жители были отрезаны от мобильной и фиксированной связи. Регулятор также описывает десять дней ремонтных работ на обоих соединениях до окончательного восстановления. [10]
Местные источники сообщают, что часть клиентов оставалась затронутой в течение этого периода, особенно там, где провайдеры не могли использовать альтернативную ёмкость. [13][18]
Эти цифры не следует объединять в одно утверждение, что все клиенты были отключены десять дней.
Аналогично сообщения о «полной аварии» следует читать в контексте. Правительственные оперативные сводки говорили, что большинство наземных линий, все интернет-сервисы и все мобильные сервисы были затронуты в определённый момент. Позднее Ofcom сказал, что голосовая связь ТфОП оставалась в основном доступной через микроволновый транспорт. [4][10]
Эти записи могут отражать разные временные метки, определения сервисов и информацию, доступную каждому учреждению. Ответственный подход — представить обе и не изобретать ложную точность.
Полезный учёт различает:
- период широкой потери сервиса;
- время временного восстановления;
- остаточные нарушения у отдельных провайдеров;
- постоянный физический ремонт;
- время простоя отдельного клиента;
- длительность экстренного обходного пути.
Любой отчёт о восстановлении также должен разделять пользователей, подписки, помещения и сервисы. Одно домохозяйство может иметь фиксированный широкополосный доступ, несколько мобильных подписок и наземную линию. Тревожная сигнализация телемедицинского ухода может отказать, пока другой голосовой сервис работает. Провайдер может восстановить совокупный трафик, пока конкретная группа остаётся отключённой.
Без записей на уровне провайдера невозможно получить полное число пострадавших пользователей или финансовые потери.
Это ограничение — не слабость, которую нужно скрывать. Это вывод о качестве публичных доказательств.
Заявления о восстановлении требуют матрицы, а не одной временной метки
Фраза «сервисы восстановлены» необходима для публичной коммуникации, но она может скрывать неравномерное восстановление.
Для Шетландских островов по крайней мере четыре заявления о восстановлении были верны в разное время:
- Временное техническое решение восстановило значительную часть широкого сервиса 20 октября.
- Позднее полиция сообщила, что обычная связь вернулась достаточно, чтобы отозвать дополнительные ресурсы. [12]
- У части клиентов и функций телемедицинского ухода всё ещё были проблемы 28 октября. [13]
- О полном восстановлении широкополосного доступа сообщалось после постоянного ремонта 30 октября. [18]
Матрица восстановления сделала бы эти различия явными.
Строки должны представлять функции сервисов:
- голосовая связь ТфОП;
- мобильная голосовая связь;
- экстренные вызовы;
- мобильные данные;
- фиксированный широкополосный доступ;
- бизнес-связь;
- сервисы совета;
- системы здравоохранения;
- телемедицинский уход;
- платёжные системы;
- связь аэропорта и транспорта.
Столбцы должны представлять доказательства:
- состояние оптического канала;
- достижимость маршрута;
- установление сессии;
- успешные транзакции;
- внешние проверки;
- телеметрия провайдера;
- подтверждение государственных органов;
- наблюдения клиентов;
- количество остаточных инцидентов.
Сервис должен переходить из состояния «деградирован» в «восстановлен» только при наличии требуемых доказательств. Стандарт не обязан быть одинаковым для каждого сервиса. Экстренные вызовы могут требовать более строгой проверки, чем обычный просмотр веб-страниц. Провайдер может заявить, что сервис восстановлен для большинства пользователей, в то время как известная группа остаётся затронутой.
Это позволяет избежать двух вредных крайностей.
Одна — ждать полной уверенности, прежде чем сообщать о каком-либо прогрессе. Другая — объявлять полное восстановление, когда вернулся только основной путь.
Многоуровневое восстановление на Шетландских островах — именно тот тип события, для которого полезна матрица.
Регуляторный урок — это доказательства, а не лозунги
Ofcom включил событие на Шетландских островах в своё обсуждение устойчивости сетей и сервисов в Connected Nations 2022. Эта публикация придаёт инциденту регуляторное значение за пределами местных сообщений. [9][10]
Урок не следует сводить к «больше регулирования» или «больше инвестиций».
Эффективные рамки устойчивости требуют доказательств того, что провайдеры:
- выявляют критические зависимости;
- понимают географические и логические общие режимы отказа;
- поддерживают достаточную альтернативную ёмкость;
- тестируют аварийное переключение при реалистичной нагрузке;
- защищают доступ к экстренным службам;
- отслеживают деградацию;
- сообщают о крупных инцидентах;
- сохраняют способность к ремонту;
- учатся на наблюдаемых отказах.
Текущие Общие условия Ofcom описывают широкие ожидания доступности и аварийного планирования. Его работа по сетевой безопасности описывает рамки снижения рисков и устранения проблем у провайдеров. Точное правовое применение зависит от провайдера, сервиса и даты, и из доступных публичных доказательств не следует никакого вывода о соответствии для конкретного события. [6][7][8]
Событие поддерживает принцип проверки.
Регуляторы не должны принимать существование второго маршрута как доказательство устойчивости. Они должны спрашивать, какие сервисы могут его использовать, с какой ёмкостью, при каком триггере и с какими доказательствами тестирования.
Это примат работающего кода, применённый к непрерывности телекоммуникаций. Схема — это заявление. Наблюдаемое аварийное переключение — доказательство.
Это различие также улучшает инвестиционные решения. Если отказ был вызван отсутствием физического разнообразия — стройте другой маршрут. Если альтернативная ёмкость существовала, но провайдеры не могли её достичь — исправьте доступ и взаимодействие. Если аварийное переключение было слишком медленным — улучшите автоматизацию и процедуры. Если экстренные системы зависели от одной технологии доступа — диверсифицируйте путь сервиса. Если в восстановлении доминировала логистика ремонта — улучшите запасные части и соглашения о судах.
Разные механизмы отказа требуют разных мер.
Шетландские острова — не Тонга
Полезное сравнение — обрыв кабеля у Тонга в 2022 году. Оба события связаны с островами, подводным оптоволокном, резервной ёмкостью, ремонтными судами и зависимостью государственных служб.
Общая лексика не делает их дубликатами.
Основной международный кабель Тонга был разорван после извержения вулкана Хунга-Тонга-Хунга-Хаапай и цунами. Событие включало вулканические процессы на морском дне, единственный международный оптоволоконный маршрут, ограниченный спутниковый резерв, международную логистику ремонта и значительно более долгую историю восстановления внутренней связи.
Событие октября 2022 года на Шетландских островах включало два номинально разнонаправленных маршрута, повреждённых в течение недели. Материалы показывают временное оптическое восстановление, активацию запасного оптоволокна, унаследованный микроволновый голосовой резерв и разные результаты у провайдеров, которые могли или не могли использовать альтернативную ёмкость.
Вопросы контроля различны.
Для Тонга:
- Почему был только один международный оптоволоконный маршрут?
- Какая резервная ёмкость существовала?
- Были ли готовы запасные части и ремонтные суда?
- Как стране следует управлять длительным ремонтом после экстремального природного события?
Для Шетландских островов:
- Были ли два установленных маршрута операционно независимы?
- Какие сервисы могли использовать оставшуюся или восстановленную ёмкость?
- Имели ли провайдеры достаточный альтернативный доступ?
- Как работали оптические, запасные оптоволоконные и микроволновые механизмы?
- Почему остаточные аварии различались по провайдерам?
Сравнение полезно только в том случае, если оно обостряет эти границы.
Чего не могут доказать публичные материалы
Несколько существенных фактов остаются неизвестными.
Публичные материалы не раскрывают:
- полную топологию оптоволокна и оборудования SHEFA-2;
- точные оптические бюджеты до и после повреждения;
- все конфигурации маршрутов;
- объёмы трафика по сервисам;
- резервирование ёмкости;
- все оптовые соглашения каждого провайдера;
- точное число клиентов по каждому провайдеру;
- полные журналы аварийного переключения;
- внутренние команды управления инцидентом;
- записи о приоритизации ремонта;
- полные финансовые потери;
- все отказы телемедицинского ухода;
- независимо проверенные меры по устранению.
Они также не устанавливают, что северный и южный инциденты имели одну причину, что какой-либо из них был злонамеренным или что какое-либо названное учреждение нарушило правовую обязанность.
Эти пробелы важны, поскольку они ограничивают распределение ответственности.
Они также определяют, что должен содержать более сильный публичный отчёт после инцидента:
- ограниченную топологию, показывающую домены отказа без раскрытия чувствительных деталей;
- таймлайн воздействия на сервис;
- доступную альтернативную ёмкость;
- результаты аварийного переключения по классам сервисов;
- доказательства доступа к экстренным службам;
- действия по временному восстановлению;
- очерёдность и ограничения ремонта;
- когорты остаточных аварий;
- уверенность в основной причине;
- тесты мер по устранению.
Качественный отчёт после инцидента не обязан раскрывать эксплуатируемые детали сети. Ему нужно достаточно доказательств, чтобы клиенты, государственные органы и регуляторы могли отличить неизбежное физическое повреждение от контролируемого сбоя непрерывности.
Тест подотчётности на практически пригодное резервирование
Событие на Шетландских островах поддерживает многоразовый тест для связи островных и удалённых регионов.
1. Составьте карту сервиса, а не только актива
Определите каждый путь от доступа клиента через локальную агрегацию, подводный транспорт, ядро провайдера, аутентификацию и внешнее взаимодействие. Отметьте общие зависимости по береговым станциям, питанию, маршрутизации и управлению.
2. Докажите географическую независимость
Задокументируйте физическое разделение в вероятных зонах повреждения, точках выхода на берег и наземных сегментах. Метки «север» и «юг» не доказывают, что все соответствующие сегменты независимы.
3. Резервируйте практически пригодную ёмкость
Укажите, сколько альтернативной ёмкости выделяется при отказе. Включите критически важные сервисы и режимы деградированной работы.
4. Привяжите провайдеров к альтернативе
Покажите, что каждый зависимый провайдер имеет техническую и коммерческую возможность использовать маршрут. Исправное оптоволокно, к которому сервис не может получить доступ, не является резервированием для этого сервиса.
5. Проверьте сквозное аварийное переключение
Проводите контролируемые учения, проверяющие маршрутизацию, сессии, DNS, аутентификацию, голосовую связь, экстренные вызовы и публичные сервисные приложения. Фиксируйте результат и устраняйте пробелы.
6. Определите минимально жизнеспособную непрерывность
Укажите, какие функции должны сохраняться, когда обычная широкополосная ёмкость недоступна. Голосовая связь, координация экстренных служб и телемедицинский уход могут нуждаться в отдельных резервных путях.
7. Инвентаризируйте неактивные механизмы контроля
Запасные оптоволокна, микроволновые линии и спутниковые терминалы должны иметь владельцев, процедуры активации, тесты совместимости и мониторинг.
8. Подготовьте физический ремонт
Поддерживайте способность локализации неисправностей, запасные части, соглашения о кабельных судах, доступ к береговым пунктам, допущения о погоде и приоритеты ремонта.
9. Измеряйте восстановление по сервисам
Используйте матрицу, различающую оптическое восстановление, восстановление маршрута и восстановление клиентского сервиса. Сохраняйте данные о остаточных когортах.
10. Публикуйте ограниченные доказательства
Объясните, что отказало, что сработало, что осталось неизвестным и как проверялись меры по устранению. Не используйте слово «устойчивый» как замену доказательствам.
Заключение
Авария на Шетландских островах в 2022 году была вызвана двумя физическими проблемами кабеля в коротком интервале. Такое совпадение было невезением. Распределение и длительность вреда для сервисов определялись механизмами контроля.
Ofcom зафиксировал примерно 16-часовую широкую потерю мобильной и фиксированной связи, поддержку унаследованной микроволновой связью для значительной части голосовой связи ТфОП, временное восстановление за счёт увеличения оптической мощности и десять дней ремонта на обоих оптоволоконных соединениях. Правительственные и приписываемые оператору записи описывают случайное повреждение рыболовным судном, активацию запасного оптоволокна и меры предосторожности со спутниковой поддержкой. Совет задокументировал остаточные аварии у отдельных провайдеров и опасения по телемедицинскому уходу.
Полиция обеспечила физический доступ к экстренным службам, пока обычная связь была неопределённой. [4][10][12][13][15]
Вместе эти факты опровергают простое допущение.
Два кабеля не равны двум пригодным для использования сервисам.
Резервирование существует только тогда, когда альтернативный путь имеет ёмкость, зависимые провайдеры могут его достичь, аварийное переключение работает, критические функции сохраняются, а восстановление можно проверить. Линия на сетевой схеме — это проектное утверждение. Доказательством подотчётности является то, что сеть сделала, когда одна линия уже была повреждена, а другая повреждена.
Это долговременный тест с Шетландских островов: не был ли установлен второй маршрут, а кто мог доказать, что он был пригоден для использования, когда от него зависела непрерывность.
Источники
- https://news.sky.com/story/complete-outage-on-shetland-leaves-phones-internet-and-computers-unusable-12725347
- https://news.stv.tv/highlands-islands/internet-and-mobile-services-restored-in-shetland-after-power-outage-caused-by-damaged-subsea-cables
- https://news.stv.tv/highlands-islands/shetlands-damaged-subsea-cable-to-faroe-islands-now-repaired-confirms-operator
- https://www.gov.scot/binaries/content/documents/govscot/publications/foi-eir-release/2024/01-b/damage-to-the-telecommunication-cable-between-scottish-mainland-and-shetland-october-2022-foi-release/documents/202200331574---annex-a/202200331574---annex-a/govscot%3Adocument/202200331574%2B-%2BAnnex%2BA.pdf
- https://www.gov.scot/publications/damage-to-the-telecommunication-cable-between-scottish-mainland-and-shetland-october-2022-foi-release/
- https://www.ofcom.org.uk/internet-based-services/network-security
- https://www.ofcom.org.uk/internet-based-services/network-security/ofcom-begins-new-role-overseeing-security-of-telecoms-networks
- https://www.ofcom.org.uk/phones-and-broadband/accessibility/general-conditions-of-entitlement
- https://www.ofcom.org.uk/phones-and-broadband/coverage-and-speeds/connected-nations-2022
- https://www.ofcom.org.uk/siteassets/resources/documents/research-and-data/multi-sector/infrastructure-research/connected-nations-2022/connected-nations-uk-report.pdf?v=321647
- https://www.parliament.scot/chamber-and-committees/questions-and-answers?ref=S6W-12628
- https://www.scotland.police.uk/what-s-happening/news/2022/october/update-landline-and-mobile-phone-outage-shetland-resolved/
- https://www.shetland.gov.uk/news/article/2404/continuing-problems-affecting-connectivity-in-shetland-including-some-telecarecommunity-alarm-lines
- https://www.shetnews.co.uk/2022/10/21/cable-fault-the-third-reported-in-waters-around-shetland-since-mid-september/
- https://www.shetnews.co.uk/2022/10/24/perfect-storm-of-cable-failure-was-incredibly-bad-luck/
- https://www.shetnews.co.uk/2022/10/25/subsea-cable-fault-took-place-a-few-kilometres-off-shetland-telecoms-chief-says/
- https://www.shetnews.co.uk/2022/10/26/more-digital-disruptions-as-cable-repairs-get-under-way/
- https://www.shetnews.co.uk/2022/10/31/shetland-fully-connected-once-again/
- https://www.theguardian.com/uk-news/2022/oct/20/shetland-loses-telephone-internet-services-subsea-cable-damaged
- https://www.theguardian.com/uk-news/2022/oct/21/telephone-and-internet-restored-in-shetland-after-cable-damage
Обзор для участников
Подробный контекст профиля
Войдите с подходящим уровнем подписки, чтобы открыть полный обзор и примечания к источникам.
Только для Стратегического сообщества
Стратегическое сообщество
Открыто всем читателям. Вступите и войдите, чтобы открыть обзоры профилей.
Вступить в Стратегическое сообществоТолько для Альянса лидеров
Альянс лидеров
Для проверенных владельцев IP-активов и руководителей. Войдите, чтобы открыть обзоры Альянса.
Вступить в Альянс лидеров
