• CoreWeave запустила многостоечный кластер NVIDIA Vera Rubin NVL72, объединив сотни GPU Rubin через Spectrum-X Ethernet
  • Компания также добавила ускорение межрегиональной записи и уровень Archive в AI Object Storage

Факт

16 сентября CoreWeave сообщила, что запустила в CoreWeave Cloud многостоечный кластер NVIDIA Vera Rubin NVL72, соединив сотни GPU Rubin через NVIDIA Spectrum-X Ethernet. Каждая стойка NVL72 объединяет 72 GPU Rubin и 36 CPU Vera, а также NVLink 6, ConnectX-9 SuperNICs и BlueField-4 DPUs.

CoreWeave также объявила о двух изменениях в AI Object Storage. Ускорение межрегиональной записи позволяет приложениям завершать запись локально, пока репликация в другой регион продолжается в фоновом режиме. Новый уровень Archive предназначен для данных, которые необходимо хранить, но к которым обращаются реже.

Компания описала автоматизированную проверку стоек: до ввода систем в эксплуатацию она охватывает обнаружение оборудования, проверку прошивок, электропитания и охлаждения, а также тестирование рабочих нагрузок. Она не раскрыла количество развёрнутых кластеров Rubin, общий объём доступных GPU-ресурсов или объём мощностей, который клиенты могут зарезервировать сейчас.

Оценка

Объединение сотен GPU в одном кластере увеличивает объём вычислительных ресурсов, который клиент может выделить под рабочую нагрузку, но эти ресурсы полезны лишь тогда, когда данные поступают к ним достаточно быстро. Задачи обучения и инференса, а также приложения с ИИ-агентами могут многократно читать, записывать и перемещать большие наборы данных, поэтому задержки хранилища и сети могут заставлять дорогостоящие ускорители простаивать в ожидании.

Ускорение межрегиональной записи меняет один этап этого процесса. Рабочая нагрузка может завершить локальную запись, не дожидаясь завершения удалённого копирования, а CoreWeave затем выполняет репликацию. Это может сократить время, которое приложение проводит в ожидании межрегиональных операций с хранилищем, хотя клиентам по-прежнему нужно понимать, когда станет доступна вторая копия и где она хранится.

Поэтому для читателей BTW анонс Rubin — не просто веха в развитии GPU. CoreWeave также работает над тем, как данные проходят через хранилище к этим ускорителям, поскольку более быстрые вычисления приносят меньше пользы, если задания снова и снова останавливаются из-за перемещения данных.

На что обратить внимание

Следует следить за клиентскими внедрениями, в которых будут раскрыты объёмы зарезервированных мощностей Rubin и производительность на конкретных рабочих нагрузках. Показатели хранилища должны включать задержку межрегиональной записи, время репликации и тарифы нового уровня Archive. Эти данные позволили бы понять, сокращают ли изменения в хранилище время ожидания и затраты одновременно с ростом доступных вычислительных ресурсов.