- CoreWeave puso en marcha un clúster NVIDIA Vera Rubin NVL72 de varios racks, conectando cientos de GPU Rubin a través de Spectrum-X Ethernet
- La empresa también incorporó la aceleración de escritura entre regiones y un nivel Archive en AI Object Storage
El hecho
CoreWeave dijo el 16 de septiembre que había puesto en marcha en CoreWeave Cloud un clúster NVIDIA Vera Rubin NVL72 de varios racks, conectando cientos de GPU Rubin a través de NVIDIA Spectrum-X Ethernet. Cada rack NVL72 combina 72 GPU Rubin con 36 CPU Vera, junto con NVLink 6, ConnectX-9 SuperNICs y BlueField-4 DPUs.
CoreWeave también anunció dos cambios en AI Object Storage. La aceleración de escritura entre regiones permite que las aplicaciones completen las escrituras localmente mientras la replicación a otra región continúa en segundo plano. Un nuevo nivel Archive está destinado a datos que deben conservarse, pero a los que se accede con menor frecuencia.
La empresa describió un proceso automatizado de validación de racks que abarca la detección de hardware, el firmware, la alimentación eléctrica, la refrigeración y las pruebas de cargas de trabajo antes de que los sistemas entren en producción. No reveló el número de clústeres Rubin desplegados, la capacidad total disponible de GPU ni cuánta capacidad pueden reservar actualmente los clientes.
La evaluación
Reunir cientos de GPU en un solo clúster aumenta la capacidad de cálculo que un cliente puede dedicar a una carga de trabajo, pero esa capacidad solo resulta útil si los datos pueden llegar a ella con suficiente rapidez. Las aplicaciones de entrenamiento e inferencia, así como las basadas en agentes, pueden leer, escribir y mover repetidamente grandes conjuntos de datos, por lo que los retrasos del almacenamiento y de la red pueden hacer que costosos aceleradores permanezcan a la espera.
La aceleración de escritura entre regiones modifica una parte de esa ruta. Una carga de trabajo puede finalizar su escritura local sin esperar a que se complete la copia remota, mientras CoreWeave gestiona después la replicación. Esto puede reducir el tiempo que una aplicación permanece a la espera del almacenamiento entre regiones, aunque los clientes aún deben entender cuándo estará disponible la segunda copia y dónde se almacena.
Para los lectores de BTW, el anuncio de Rubin es, por tanto, más que un hito relacionado con las GPU. CoreWeave también está trabajando en la ruta de almacenamiento en torno a esos aceleradores, porque una mayor velocidad de cálculo aporta menos valor cuando las tareas se detienen repetidamente por el movimiento de datos.
Qué seguir de cerca
Hay que seguir de cerca los despliegues de clientes que revelen la capacidad Rubin reservada y el rendimiento en cargas de trabajo identificadas. Los resultados de almacenamiento deberían incluir la latencia de escritura entre regiones, el tiempo de replicación y los precios del nuevo nivel Archive. Esas cifras mostrarían si los cambios de almacenamiento reducen el tiempo de espera y el coste a la vez que aumenta la capacidad de cálculo disponible.
Informe para miembros
Contexto ampliado del perfil
Inicia sesión con el nivel de membresía adecuado para desbloquear el informe completo y las notas de las fuentes.
Solo para Strategic Circle
Strategic Circle
Abierto a todos los lectores. Desbloquea informes de perfil después de unirte e iniciar sesión.
Únete a Strategic CircleSolo para Leadership Alliance
Leadership Alliance
Para propietarios y directivos cualificados de activos de propiedad intelectual; inicia sesión para desbloquear los informes de la alianza.
Unirse a Leadership Alliance

