Резюме
- Инцидент начался около 01:35 JST 2 июля 2022 года во время обслуживания магистрального транспортного маршрутизатора в сетевом центре Tama компании KDDI. Ошибочная или устаревшая процедура не предусматривала изменение маршрутизации VoLTE, из-за чего возник периодический сбой ответов, который спровоцировал повторные запросы регистрации местоположения.
- Нагрузка от повторных попыток распределилась по распределённым функциям управления вызовами VoLTE и базам данных абонентов. Шесть узлов управления вызовами позже перезапускались из резервных копий, записанных при несогласованном внутреннем состоянии, поэтому сброс не гарантированно возвращал их в чистое состояние.
- Восстановление требовало большего, чем отмена изменения маршрута. KDDI использовала управление потоками, сброс функций управления вызовами, изоляцию PGW и сброс сессий, перераспределение нагрузки баз данных абонентов и в итоге изоляцию шести постоянно аномальных узлов VoLTE.
- Официальное окно затронутых услуг составило 61 час 25 минут — с 01:35 2 июля до 15:00 4 июля. KDDI подтвердила полную работоспособность всех сетей связи только в 15:36 5 июля, примерно через 86 часов после начала. Это разные операционные часы.
- Министерство внутренних дел и коммуникаций расценило событие как серьёзную аварию и выявило недостатки в управлении процедурами, проектировании защиты от перегрузок, тестировании восстановления при высокой нагрузке, учениях по инцидентам и публичной коммуникации. Возвраты KDDI и заявленные меры по предотвращению повторения были действиями оператора, а не наложенным регулятором денежным штрафом или судебным решением.
У инцидента несколько временных отсчётов
KDDI относит начало сбоя связи примерно к 01:35 по японскому стандартному времени в субботу 2 июля 2022 года. На консолидированной англоязычной странице об инциденте указан период воздействия, завершившийся в 15:00 в понедельник 4 июля, — всего 61 час 25 минут. Министерство внутренних дел и коммуникаций (MIC) использовало то же окно времени воздействия в своём специальном отчёте о проверке.
Kyodo сообщило о более поздней вехе: KDDI подтвердила, что все сети связи полностью заработали в 15:36 во вторник 5 июля. Это примерно через 86 часов после начала инцидента. Более длинный интервал не должен заменять показатель 61 час 25 минут, а более короткий — стирать дополнительную работу по тестированию и нормализации. Они отвечают на разные вопросы.
Одни часы описывают период, который KDDI и регулятор отнесли к затронутым услугам. Другие заканчиваются, когда оператор подтвердил нормальную работу всех сетей. Между ними — снятие ограничений потоков, проверки стабильности сети, наблюдение за успешностью голосовых вызовов, исправление несогласованного состояния и решение о том, что система снова может нести обычную нагрузку. Отчёт, который называет любой из этих шагов просто «восстановленным», теряет доказательства, необходимые для оценки восстановления.
Оценки воздействия также относятся к отдельным снимкам источников. В отчёте MIC примерно 23,16 млн человек затронуты голосовой связью и не менее 7,75 млн — передачей данных, что в сумме даёт не менее 30,91 млн. Более поздняя консолидированная страница KDDI сообщает примерно о 22,78 млн для голоса и не менее 7,65 млн для данных. Reuters, сообщая, когда детальная причина ещё расследовалась, приводил раннюю потенциальную подверженность до 39,15 млн пользователей, включая 260 тыс. корпоративных клиентов.
Эти цифры нельзя усреднять или складывать. Ранний максимум описывал потенциальную подверженность во время развивающегося инцидента. Показатели MIC и KDDI получены из разных официальных срезов и расчётов. Группы пользователей голоса и данных могут пересекаться. Контракты, подключения, люди и попытки использования услуг — не взаимозаменяемые единицы. Сохранение каждого определения — это не статистическая осторожность ради неё самой; именно это не даёт крупному инциденту превратиться в число, собранное автором, а не установленное доказательствами.
Пропущенное изменение маршрута создало частичный отказ
Техническая последовательность началась во время обслуживания магистрального транспортного маршрутизатора в сетевом центре Tama. MIC установило, что в работе использовалась ошибочная или устаревшая процедура. Процедура не предусматривала необходимое изменение маршрутизации для трафика VoLTE, из-за чего трафик остался направленным на путь, который уже не работал так, как предполагалось.
Возникший отказ был периодическим, а не полностью тотальным. MIC реконструировало состояние, при котором ответы, связанные с затронутым путём, не проходили примерно в половине случаев. Это различие важно. Устройство или сетевая функция, не получающая успешного ответа, может объявить жёсткий отказ и перейти на известную альтернативу. Система, которая иногда работает, а иногда отказывает, может оставаться достаточно «здоровой», чтобы продолжать попытки по тому же пути.
Мобильная голосовая связь поверх LTE зависит от регистрации местоположения. Устройство должно подтвердить, что оно является авторизованным абонентом, и зарегистрировать, где оно доступно, прежде чем обычные входящие и исходящие голосовые вызовы смогут завершиться. Когда подтверждения не возвращались, устройства и сетевые функции считали регистрацию незавершённой и повторяли попытки.
Повторные попытки по отдельности рациональны. Они становятся опасными, когда миллионы конечных точек и распределённые управляющие функции одновременно принимают одно и то же решение. Каждый потерянный ответ порождал ещё один запрос. Каждый дополнительный запрос потреблял больше ресурсов управления вызовами и баз данных абонентов. По мере падения ёмкости больше запросов терпело неудачу, что порождало ещё больше повторных попыток. Сеть начала усиливать исходную неисправность.
MIC оценило, что функции управления вызовами VoLTE в Tama испытывали нагрузку примерно в семь раз выше нормальной. Другие площадки VoLTE испытывали примерно 6,5-кратную нагрузку, поскольку архитектура распределяла работу и повторные попытки по стране. Локальная ошибка обслуживания попала в национально связанную систему управления.
Это первая граница подотчётности. Ошибка обслуживания объясняет, почему начался аномальный трафик. Сама по себе она не объясняет, почему отказ распространился по всей стране и длился несколько дней. Для этого необходимо изучить, как действующая топология распределяла сигнализацию, как логика повторных попыток вела себя при частичной потере ответов и распознавала ли защита от перегрузки это конкретное состояние как аномальное.
Перегрузка перекинулась с голосового управления на состояние абонентов
Узлы VoLTE работали не изолированно. Регистрация местоположения и установление голосовых сессий зависели от баз данных абонентов, используемых для аутентификации, политик, тарификации и состояния местоположения или услуг. По мере роста повторных попыток VoLTE росли и запросы к этим базам данных.
MIC описывает усиливающий цикл. Перегрузка баз данных абонентов порождала сообщения об ошибках. Эти ошибки заставляли устройства и сетевые функции отправлять больше запросов. Больше запросов усиливало перегрузку. Некоторое поведение устройств также означало, что неудачное установление голосовой сессии влияло на зарегистрированное состояние устройства, поэтому услуги передачи данных могли становиться недоступными периодически, хотя база данных абонентов, специфичная для данных, не была исходной точкой перегрузки.
Эта граница важна для публичного описания. Было бы неточно говорить, что все мобильные услуги передачи данных непрерывно не работали по всей Японии. Доказательства подтверждают общенациональный сбой связи с последствиями для голоса, SMS и зависящими от устройства или связанными с управлением потоками эффектами для данных. Разные устройства и услуги могли демонстрировать разные симптомы одновременно.
Перегрузка также повредила согласованность управляющего состояния. MIC установило, что повторяющиеся изменения аутентификационных сессий при высокой нагрузке не синхронизировались корректно внутри некоторых узлов управления вызовами VoLTE. Шесть узлов записали периодические резервные копии, пока их внутреннее состояние было несогласованным. Когда операторы перезапускали функции управления вызовами с последних резервных копий, эти шесть узлов возвращались с всё ещё присутствующим аномальным состоянием.
Поэтому сброс не был эквивалентен восстановлению. Он перезапускал оборудование, но состояние, загруженное при старте, продолжало порождать ошибки аутентификации и повторные запросы регистрации. Действие, обычно очищающее неисправность, сохраняло часть неисправности, потому что сам артефакт восстановления отражал перегруженную систему.
Дополнительная несогласованность возникла между функциями VoLTE, базами данных абонентов и пакетными шлюзами (PGW). Информация о сессиях, которую следовало удалить, не всегда удалялась, пока база данных была перегружена. Поздние сессии могли затем конфликтовать с состоянием, оставшимся в системе. Исправление этого несоответствия заняло время и должно было учитывать ёмкость оборудования, уже находившегося под давлением.
Это самый сильный урок инцидента на уровне работающего кода. Файл резервной копии — это запись, но он настолько надёжен, насколько надёжно зафиксированное в нём состояние. Документированная процедура сброса — это намерение, но реальный результат зависит от загруженных данных, поступающего трафика и взаимодействия между системами. В сложном инциденте операторам нужно доказательство того, что восстановление привело сеть в чистое состояние, а не просто подтверждение, что команда выполнена.
Управление трафиком было необходимым, но недостаточным
Реагирование KDDI включало несколько форм вмешательства. MIC перечисляет ограничения трафика запросов на подключение и трафика VoLTE, сбросы функций управления вызовами, изоляцию части PGW для снижения нагрузки на базы данных абонентов, сбросы сессий PGW для исправления несогласованной информации о сессиях и изменение того, какие ресурсы баз данных абонентов получали трафик PGW.
Эти действия затрагивали разные части цикла. Управление потоками снижало новый спрос. Изоляция PGW и сбросы сессий изменяли состояние, представляемое абонентским системам. Перераспределение нагрузки стремилось не дать одному пути к базе данных оставаться узким местом. Сбросы управления вызовами пытались очистить аномальную обработку. Ни одно отдельное действие не может честно представлять всё восстановление.
Шесть узлов управления вызовами VoLTE с сохраняющимся аномальным состоянием оказались особенно сложными. MIC установило, что попытка блокирующего процесса не завершилась нормально из-за того, что узлы уже были аномальными. Они продолжали генерировать избыточные сигналы после того, как предыдущие шаги снизили другие источники нагрузки. Итоговая изоляция этих шести узлов остановила постоянный источник повторных попыток, после чего перегрузка спала.
Последовательность выявляет типичную ошибку в языке восстановления. Оператор может завершить запланированные физические или конфигурационные работы, а работающая сеть остаётся перегруженной. Он может восстановить большинство путей данных, а голосовые вызовы всё ещё под ограничениями. Он может достичь нормальных показателей успешности вызовов, продолжая проверять все значимые системы, потому что длительная высокая нагрузка может оставить скрытое состояние.
MIC позднее раскритиковало различие, которое KDDI сообщала между завершением работ по восстановлению и полным возобновлением услуг. KDDI предполагала, что за завершением работ последуют снятие ограничений потоков и подтверждение нормальности. Некоторые пользователи и новостные организации поняли «работы по восстановлению завершены» как «услуга восстановлена». В действительности перегрузка и ограничения трафика продолжались.
Это была не только коммуникационная проблема. Это была проблема измерений, проявившаяся через язык. Если система статусов не может указать, какие технические и сервисные условия пройдены, публичные обновления будут тянуться к расплывчатым вехам. Более сильная модель инцидента публикует отдельные доказательства того, что источник неисправности устранён, рост повторных попыток сдержан, перегрузка снята, состояние сессий согласовано, ограничения потоков сняты, успешность голоса и данных стабилизировалась, а сквозные зависимые услуги проверены.
Сбой вышел за пределы телефонных трубок
Собственный отчёт KDDI перечисляет влияние на обновления доставки и коммуникации водителей, сервисы подключённых автомобилей, сбор метеоданных, счётчики воды, банкоматы, аэропортовую беспроводную связь и системы оплаты в автобусах. Reuters независимо сообщал о сбоях, затронувших метеоданные, доставку посылок, банковское обслуживание и подключённые автомобили.
Эти примеры показывают, почему непрерывность мобильного ядра — это вопрос общей инфраструктуры. Мобильное соединение может быть управляющим или отчётным путём внутри другой услуги. Видимый сбой для одного пользователя — телефон, который не может совершить вызов. Для логистического оператора это может быть потеря обновлений статуса. Для государственного органа — отсутствие наблюдений. Для транспортного или банковского сервиса — невозможность удалённой конечной точки завершить обычную транзакцию.
Примеры должны сохранять ограничение: они не устанавливают, что каждая перечисленная услуга не работала по всей стране весь период сбоя. Они демонстрируют охват зависимостей, а не универсальные почасовые графики для каждой услуги.
Экстренные вызовы несут самые острые последствия для непрерывности. Reuters сообщило об обеспокоенности министра связи тем, что пожарные и экстренные вызовы, используемые для защиты жизни и имущества, были затруднены. Kyodo позже сообщило, что часть пользователей не могла дозвониться до японских экстренных номеров 110 или 119 в течение длительного периода. Набор источников не даёт числа неудачных попыток экстренных вызовов, уникальных чрезвычайных ситуаций, травм или смертей.
Это отсутствие не следует заполнять спекуляциями. Подтверждённый вывод уже серьёзен: доступ к экстренным номерам был нарушен во время длительного общенационального сбоя мобильной связи. Вопрос подотчётности в том, может ли оператор показать, что у экстренной связи есть жизнеспособный путь, когда регистрация голосовых вызовов, аутентификация абонентов или обычное управление трафиком отказывают.
Регуляторная сводка фиксирует сбои контроля, а не любую ответственность
MIC отнеслось к сбою как к серьёзной аварии и созвало специальную техническую проверку. Его отчёт не свёл причину к одной человеческой ошибке. Он выявил недостатки в выборе и утверждении процедур, проверках нормальности услуг, оценке рисков, проектировании защиты от перегрузки, оценке общенационального распространения, тестировании сброса при высокой нагрузке, сложных процедурах восстановления, учениях по инцидентам и коммуникации с клиентами.
Этот многоуровневый вывод важен. Ошибочная процедура может запустить событие, но национальная устойчивость зависит от контролей, предполагающих, что процедуры и люди иногда отказывают. Состояния частичного ответа должны распознаваться. Поведение повторных попыток должно быть ограничено. Распределённая архитектура нуждается в зонах сдерживания. Резервные копии и сбросы должны тестироваться при аномальной нагрузке. Операционным командам нужен отработанный путь выхода из состояний, которые обычная автоматизация не разрешает.
KDDI сообщила об изменениях, включая усиленный контроль процедур и утверждений, лучшее обнаружение перегрузки, пересмотр проектирования защиты от перегрузки, пересмотренные процедуры восстановления, инструменты восстановления и улучшенное информирование клиентов. Эти меры соответствуют задокументированным путям отказа. Доступный публичный отчёт не даёт текущей, независимой, всеобъемлющей проверки их эффективности в 2026 году.
KDDI также объявила компенсации клиентам. Её консолидированная страница отделяет возвраты на условиях для клиентов, которые не могли пользоваться всеми видами связи более 24 часов подряд или при эквивалентном условии, от извинительного возврата 200 иен для гораздо большей группы клиентов. Kyodo сообщило об ожидаемой стоимости около 7,3 млрд иен и добровольном снижении зарплаты президента KDDI.
Это компенсационные и управленческие меры оператора. Они не являются наложенным регулятором денежным штрафом, уголовной санкцией или судебным решением об ответственности. Публичный отчёт подтверждает классификацию серьёзной аварии, выводы проверки MIC, заявленные корректирующие меры и программу компенсаций. Он не поддерживает превращение этих результатов в правовое суждение, которого источники не описывают.
Доказательства непрерывности должны описывать работающую услугу
Инцидент подсказывает практическую иерархию доказательств. Первый уровень — предполагаемое состояние: утверждённая процедура, ожидаемый маршрут, настроенные средства контроля перегрузки, план восстановления и политика уведомления клиентов. Эти записи важны, но сбой показывает, что они не могут сами по себе подтвердить непрерывность.
Следующий уровень — наблюдаемое техническое состояние. Операторам нужно знать, какой путь фактически использует сигнализация VoLTE, возвращаются ли подтверждения, как распределяются повторные попытки, какие узлы управления вызовами синхронизированы, согласуется ли состояние сессий абонентов и PGW и загрузил ли сброс чистую резервную копию. Эти измерения показывают, что сеть делает, а не что её документы говорят, что она должна делать.
Высший уровень — завершение услуг. Успешное состояние узлов не доказывает, что пользователи могут регистрироваться, совершать и принимать вызовы, отправлять сообщения, пользоваться данными или дозвониться до экстренного центра. Восстановлению нужны сквозные проверки на репрезентативных устройствах, в регионах, услугах и зависимых организациях. Публичная веха должна следовать за этими результатами.
Регуляторные отчёты сохраняют жизненно важный учёт произошедшего. Они фиксируют терминологию, цифры, хронологию и ожидания по исправлениям. Но отчёт не может нести трафик, остановить повторные попытки, согласовать сессии или завершить экстренный вызов. Его операционная ценность — в проверках, которые он создаёт для работающей сети.
Поэтому решающий вопрос после сбоя KDDI 2022 года не в том, был ли исправлен исходный маршрут. Он в том, могут ли нынешние контроли доказать, что аналогичный периодический сбой останется локальным, спрос на повторные попытки останется ограниченным, артефакты восстановления останутся надёжными, операторы сохранят видимость, а публичный язык статусов будет соответствовать наблюдаемым результатам для клиентов.
Чего публичные доказательства не устанавливают
Отчёт MIC даёт детальную реконструкцию, но публичные источники не раскрывают все внутренние журналы, каждую команду последовательности восстановления или каждого владельца отдельного решения. Они не устанавливают полную перепись воздействия на каждое устройство. Они не оценивают количественно сбои экстренных вызовов или последующий экономический ущерб.
Официальные оценки воздействия также менялись между срезами. Это не делает источники бесполезными. Это означает, что у каждой цифры нужны владелец и метод. Ранняя цифра потенциальной подверженности 39,15 млн принадлежит оперативным сообщениям. Оценки MIC — 23,16 млн для голоса и 7,75 млн для данных — принадлежат его отчёту о проверке. Более поздние цифры KDDI — 22,78 млн и 7,65 млн — принадлежат её консолидированной клиентской странице.
Доказательства также не могут подтвердить текущую эффективность на основе списка мер, внедрённых или запланированных в 2022 году. Инструмент мог быть развёрнут без покрытия каждого значимого узла. Процедура могла измениться без тестирования на периодические потери и общенациональную нагрузку повторных попыток. Учения по восстановлению могут проходить в лабораторных условиях, которые не воспроизводят несогласованное состояние абонентов.
Эти ограничения не ослабляют аргумент подотчётности. Они удерживают его привязанным к тому, что можно продемонстрировать. Инцидент начался с конкретного сбоя обслуживания и маршрутизации, распространился через наблюдаемые механизмы повторных попыток и перегрузки, сохранялся из-за несогласованного состояния, затронул критически важные зависимости и потребовал многоэтапного восстановления. Ответственный вывод касается контролей и доказательств, а не выдуманного вреда или личной вины.
Источники
- KDDI — «Сбой связи 2 июля и наши ответные меры»
- Совет по проверке аварий в сфере телекоммуникаций Министерства внутренних дел и коммуникаций Японии (MIC), отчёт о проверке серьёзной аварии KDDI и Okinawa Cellular 2 июля 2022 года
- Reuters через Euronews — «KDDI планирует восстановить услуги в воскресенье после сбоя, затронувшего 40 млн пользователей»
- Kyodo News — «KDDI выплатит компенсации 36 млн человек, затронутых сетевым сбоем»
Обзор для участников
Подробный контекст профиля
Войдите с подходящим уровнем подписки, чтобы открыть полный обзор и примечания к источникам.
Только для Стратегического сообщества
Стратегическое сообщество
Открыто всем читателям. Вступите и войдите, чтобы открыть обзоры профилей.
Вступить в Стратегическое сообществоТолько для Альянса лидеров
Альянс лидеров
Для проверенных владельцев IP-активов и руководителей. Войдите, чтобы открыть обзоры Альянса.
Вступить в Альянс лидеров
