Кратко
- В ходе NCCL-теста всех соединений SoftBank нашла один линк, работавший на неуказанной доле нормальной скорости, хотя LED был зелёным, Link Status — UP, а оптическая мощность — нормальной. Эти признаки корректно описывали своё состояние, но не подтверждали пригодность для workload.
- В материалах JANOG58 перечислены switch, optics, NIC, волокно и загрязнённый connector как области локализации. Корневая причина, точное соотношение, реальные BER/FEC и измеренный ремонт не опубликованы. Следующие страницы содержат учебные примеры, а не телеметрию инцидента.
- Приёмка rack-scale системы должна соединять воспроизводимый baseline производительности каждого линка, данные Layer 1, идентичность топологии, ограниченное изменение и повтор того же теста после ремонта. Число установленных GPU, видимый ASN и достижимый prefix внутреннюю рабочую ёмкость не сертифицируют.
Доклад Yasuhiro Uchida и Chaocheng Chang прозвучал 16 июля 2026 года во второй день JANOG58. Официальная сессия SoftBank называлась Rack-Scale GPUサーバーのNW設計と運用までの苦悩. Её финальная 56-страничная презентация рассматривает первую rack-scale GPU среду оператора как связанный объект: сеть, электропитание, жидкостное охлаждение, кабели, управление и единицы предоставления сервиса.
На странице с проверкой производительности помещены четыре наблюдения. NCCL benchmark прошёл по всем линкам. Один из них давал только долю обычной скорости. Презентация не указывает размер этой доли и не говорит об одной трети. При этом LED оставался Green, Link Status — UP, а оптическая мощность — в норме.
Из этих данных нельзя вывести точную степень деградации. Зато можно строго установить границу приёмки: условия физического присутствия и административной готовности выполнялись, а требуемая коллективной нагрузкой передача — нет.
Зелёный индикатор сообщает, что схема состояния видит предусмотренное условие. Link Status UP сообщает о достижении административного или протокольного состояния. Нормальная оптическая мощность говорит, что принятый свет не пересёк настроенный порог тревоги. Ни один из этих признаков не обещает достаточный запас коррекции, одинаково здоровые lane или end-to-end rate для NCCL collective.
Поэтому материал не обесценивает state и power. Он показывает, что ответы этих датчиков уже вопроса, который задаёт сервисная приёмка. Нужна дополнительная проверка именно того свойства, которое будет продаваться.
Отдельный девятистраничный preread доступен по официальной ссылке с именем j56-lt4.pdf. Он посвящён жидкостно охлаждаемым switches, proprietary-интерфейсам cooling и standardisation. Это полезный контекст физической зависимости, но не краткая версия происшествия. В нём нет отсутствующих счётчиков или результата ремонта.
Масштаб архитектуры объясняет цену такого разрыва. GB200 NVL72 содержит 18 compute trays по четыре B200 GPU и девять switch trays по два NVSwitch. Всего это 72 GPU и 36 CPU. SoftBank указывает потребление свыше 100 kW. Документация NVIDIA подтверждает референсную компоновку и описывает passive cable backplane, power shelves, busbar и manifolds жидкостного охлаждения.
Эти сведения подтверждают устройство продукта, а не поведение проблемного линка. Но они показывают экономический механизм: относительно небольшая сетевая зависимость способна удерживать за собой гораздо более дорогие вычислительные активы. Ускорители остаются в инвентаре и под питанием, тогда как предоставляемая tenant ёмкость уменьшается.
Внешняя сеть разделена на три fabric. Compute Fabric обслуживает GPU scale-out. Converged Fabric несёт front-end, storage и NCCL bootstrap. OOB Fabric обеспечивает управление switches и servers, мониторинг facility и управление NVSwitch. Разделение функций делает операционные границы видимыми, но не устраняет общие кабели, питание, охлаждение, firmware и процессы.
В разделе OOB есть точное ограничение. Связь по management port к leaf switches может стать единой точкой отказа. Reachability loopback через underlay Compute Fabric способна улучшить доступ к управлению с меньшими затратами на кабели. Авторы отдельно говорят, что это не замена OOB. Путь, помогающий ремонтировать production fabric, не должен становиться единственным путём, который сам зависит от исправности этого fabric.
Случай с низкой скоростью открывает аналогичную границу. Коллективная операция ограничена медленной или деградировавшей частью коммуникационного графа, а не средним состоянием ports. Система может видеть все устройства, management может отвечать, но job не получает ожидаемую полосу.
После обнаружения симптома презентация перечисляет поверхности диагностики: switch, optics, NIC, fibre и загрязнённый connector. Это цепочка кандидатов, а не опубликованный root cause. Ошибка может находиться в transmitter, receiver, lane, module, connector или cable и проявляться как снижение workload throughput на другом уровне.
Следующие страницы объясняют pre-FEC BER, post-FEC BER и FEC histogram, показывают нормальные и ненормальные patterns и замену optics в учебной схеме. Эти числа и действия не относятся автоматически к выявленному линку. SoftBank не утверждает, что он показал нарисованные значения, попал в указанные bins или восстановился после module swap.
Такое различие не формально. BER может показать ошибки до коррекции. FEC может показать расход коррекционного запаса. Замена одного ограниченного компонента может проверить гипотезу. Но доказательством восстановления будет лишь повтор первоначального теста по всем соединениям в тех же условиях.
В открытом наборе нет before/after benchmark, названного компонента, точного throughput ratio, реальных incident counters или клиентского воздействия. Поэтому из него нельзя собрать завершённую историю о причине и ремонте. Он документирует обнаружение приёмочного blind spot.
Предлагаемое изменение эксплуатации опубликовано яснее. Презентация называет Link UP = OK недостаточным, предлагает глубже учитывать BER и FEC, еженедельно и ежемесячно собирать и анализировать interface и optics logs и искать признаки деградации до interface down.
Это проект мониторинга, а не доказанный predictive outcome. Источники не публикуют thresholds, retention, false positives, заранее найденный отказ или прирост availability. Поддерживаемый факт уже: оператор выбрал более близкий к физическому механизму слой доказательств. Результативность такой программы остаётся неизвестной.
Единица предоставления сервиса меняет и границу ответственности. SoftBank сравнивает rack, tray и GPU. В выводе говорится, что сейчас предлагаются rack и tray. GPU-level вариант рассмотрен, но не объявлен текущей услугой.
Целый rack проще выделить одному клиенту, но вместе с ним передаются общие зависимости Compute Fabric, CDU, NVSwitch, compute trays и busbar. Tray подходит меньшему покупателю, но требует NVLink partition. Процесс управления NVSwitch общий для rack и отмечен как single point of failure; более высокий SLA требует redundancy на уровне rack или scalable unit.
Власть распределена вдоль этих границ. SoftBank контролирует topology, qualification, workload admission, monitoring и решение о restoration на собственной платформе. NVIDIA и поставщики switch, NIC и optics контролируют reference design, firmware, privileged diagnostics, квалификационные списки и support remedy. Facility-команда контролирует электричество, охлаждение и физический доступ.
JANOG контролирует публикацию сессии. Это легитимная и ограниченная роль. Она делает опыт доступным для проверки, но не даёт конференции права принимать production link или распоряжаться чужой сетью.
Плательщики также видны. SoftBank финансирует плотную кабельную инфраструктуру, optics, switches, spares, репрезентативную лабораторию, электропитание, cooling и труд специалистов через границы поставщиков. Workload owner платит задержкой jobs и простоем ускорителей, если деградировавший link проходит номинальный gate. Малому покупателю труднее содержать тестовый rack, запасные части и экспертизу, поэтому он сильнее зависит от интегрированного поставщика.
Выгоду от качественной приёмки получает оператор, когда установленное оборудование превращается в оплачиваемую услугу, и tenant, когда производительность доказуема и восстанавливаема. Поставщики получают доход от систем и support. Однако баланс нарушается, если один vendor эксклюзивно контролирует benchmark, диагностику и определение успешного ремонта.
В декабре 2025 года SoftBank сообщила, что платформа с 1 224 Blackwell GPU начала работу 22 декабря, а расширение более чем до 4 000 запланировано. Первое число — заявление оператора о развёртывании, второе — план. Ни одно не измеряет количество линков, прошедших acceptance baseline в конкретный момент.
Нельзя переносить и результат другой системы. TOP500 описывает SoftBank CHIE-4 как DGX B200 с InfiniBand NDR400. Его позиция относится к этой системе, а не к среде GB200 NVL72 из JANOG58.
Проверяемый контрфактический процесс начинается с идентичности topology. Для каждого обязательного линка сохраняется ожидаемое распределение NCCL или другой portable workload baseline. С ним связываются link state, оптическая мощность, lane counters, pre/post-FEC BER, FEC histogram, module, fibre, оба switch/NIC endpoint, firmware и timestamp.
При отклонении изменяется один ограниченный компонент или параметр за раз. Counter до и после изменения остаются в записи. Затем повторяется тот же all-link test. Trend, alert, ticket, component change и verified restoration фиксируются как разные состояния.
Tenant не обязательно получает все proprietary counters. Но service owner должен доказать, что принятый link достиг заявленной скорости и после вмешательства вернулся в то же распределение. Закрытый после замены детали ticket не доказывает возврат workload capacity.
ASN и BGP находятся на внешнем слое. Management и customer prefixes могут оставаться доступными, пока внутренний collective path недодаёт производительность. Номерные ресурсы и маршрутизация подтверждают identity и reachability до service edge. Они не сертифицируют GPU fabric за prefix и не передают RIR, standards body или конференции власть над приёмкой.
Точный вывод из JANOG58 не сводится к «смотрите BER». Номинальный state, физические данные и workload performance должны быть связаны с одной topology и одной историей вмешательств. Рабочая ёмкость начинается там, где результат воспроизводим.
Источники
Обзор для участников
Подробный контекст профиля
Войдите с подходящим уровнем подписки, чтобы открыть полный обзор и примечания к источникам.
Только для Стратегического сообщества
Стратегическое сообщество
Открыто всем читателям. Вступите и войдите, чтобы открыть обзоры профилей.
Вступить в Стратегическое сообществоТолько для Альянса лидеров
Альянс лидеров
Для проверенных владельцев IP-активов и руководителей. Войдите, чтобы открыть обзоры Альянса.
Вступить в Альянс лидеров

