• COREWEAVE и Parallel Works развернули для исследовательской программы NODES агентства DARPA управляемую вычислительную среду для ИИ на базе систем NVIDIA H100
  • Каждая исследовательская команда получает гарантированный объём вычислительных ресурсов и может использовать дополнительные общие мощности, когда они доступны

Факты

COREWEAVE и Parallel Works развернули управляемую среду для ИИ и высокопроизводительных вычислений для программы DARPA Network of Optimal Dynamic Energy Signatures (NODES). Исследователи получают доступ к системе через платформу ACTIVATE компании Parallel Works, которая обеспечивает вход в систему, управление учётными записями, выделение ресурсов, планирование и отчётность об использовании. COREWEAVE предоставляет базовые вычислительные ресурсы, хранилища и сетевую инфраструктуру, включая системы NVIDIA HGX H100 и высокоскоростные соединения InfiniBand.

Вычислительные мощности распределены между исследовательскими командами NODES. Каждая команда получает гарантированную квоту и также может использовать общий пул, когда в нём есть свободные ресурсы. Компании предоставляют техническую поддержку, поэтому отдельным командам не приходится самостоятельно создавать и администрировать собственные облачные среды.

В рамках NODES разрабатываются инструменты глубокого обучения для анализа белковых последовательностей и прогнозирования биологических функций. DARPA разрешает исследователям использовать собственные вычислительные ресурсы, однако заявляет, что итоговые продукты и демонстрации возможностей должны запускаться на государственных высокопроизводительных вычислительных системах. Новая облачная среда поддерживает исследовательскую программу, но не свидетельствует о том, что программа NODES достигла своих научных целей.

Оценка

Исследовательским командам нужны не только GPU — им необходим практичный способ получать к ним доступ. В данном случае Parallel Works отвечает за учётные записи, доступ и планирование, а COREWEAVE предоставляет вычислительную платформу. Это должно уменьшить объём инфраструктуры, которую исследователям NODES нужно развернуть и администрировать, прежде чем они смогут приступить к работе.

Важно, как будет работать совместное использование мощностей. У каждой команды есть гарантированная квота, а при наличии свободных ресурсов она может получить дополнительные мощности из общего пула. Это даёт исследователям предсказуемую основу для планирования и позволяет эффективнее использовать простаивающие ресурсы. Главный вопрос — насколько хорошо эта схема будет работать, когда нескольким командам одновременно потребуется больше вычислительной мощности.

Для читателей BTW это полезный пример предоставления инфраструктуры ИИ как управляемого сервиса, а не простой аренды оборудования. Её ценность станет понятнее, если исследователи смогут быстро получать доступ к системе, запускать задачи без долгого ожидания и тратить меньше времени на управление самой вычислительной средой.

На что обратить внимание

Следует наблюдать за тем, как быстро исследовательские команды подключаются к платформе и как общий пул мощностей работает по мере роста спроса. Данные о времени ожидания, использовании ресурсов, сбоях вычислительных заданий или обращениях в техническую поддержку показали бы, получают ли команды NODES на практике предсказуемый доступ.