• CoreWeave nahm einen Cluster des Typs NVIDIA Vera Rubin NVL72 mit mehreren Racks in Betrieb und vernetzte Hunderte Rubin-GPUs über Spectrum-X Ethernet
  • Das Unternehmen ergänzte AI Object Storage außerdem um regionenübergreifende Schreibbeschleunigung und die Speicherklasse Archive

Die Fakten

CoreWeave gab am 16. September bekannt, in der CoreWeave Cloud einen Cluster des Typs NVIDIA Vera Rubin NVL72 mit mehreren Racks in Betrieb genommen zu haben. Der Cluster verbindet Hunderte Rubin-GPUs über NVIDIA Spectrum-X Ethernet. Jedes NVL72-Rack kombiniert 72 Rubin-GPUs mit 36 Vera-CPUs sowie NVLink 6, ConnectX-9 SuperNICs und BlueField-4 DPUs.

CoreWeave kündigte außerdem zwei Neuerungen für AI Object Storage an. Mit der regionenübergreifenden Schreibbeschleunigung können Anwendungen Schreibvorgänge lokal abschließen, während die Replikation in eine andere Region im Hintergrund weiterläuft. Die neue Speicherklasse Archive ist für Daten vorgesehen, die aufbewahrt, aber seltener abgerufen werden müssen.

Das Unternehmen beschrieb eine automatisierte Rack-Validierung, die Hardwareerkennung, Firmware, Stromversorgung, Kühlung und Workload-Tests umfasst, bevor Systeme in den Produktivbetrieb gehen. Es machte keine Angaben dazu, wie viele Rubin-Cluster bereitgestellt wurden, wie hoch die insgesamt verfügbare GPU-Kapazität ist oder wie viel Kapazität Kunden derzeit reservieren können.

Die Einordnung

Wenn Hunderte GPUs in einem Cluster zusammengeführt werden, steigt die Rechenkapazität, die ein Kunde einem Workload zuweisen kann. Diese Kapazität ist jedoch nur dann nützlich, wenn die Daten die Beschleuniger schnell genug erreichen. Beim Training, bei der Inferenz und in agentenbasierten Anwendungen können große Datensätze wiederholt gelesen, geschrieben und verschoben werden; Speicher- und Netzwerkverzögerungen können dadurch teure Beschleuniger warten lassen.

Die regionenübergreifende Schreibbeschleunigung verändert einen Teil dieses Pfads. Ein Workload kann seinen lokalen Schreibvorgang abschließen, ohne auf die Fertigstellung der Kopie in der anderen Region zu warten; CoreWeave übernimmt die Replikation anschließend. Das kann die Wartezeit einer Anwendung auf regionenübergreifende Speichervorgänge verkürzen. Kunden müssen jedoch weiterhin wissen, wann die zweite Kopie verfügbar ist und wo sie gespeichert wird.

Für das BTW-Publikum ist die Rubin-Ankündigung daher mehr als ein GPU-Meilenstein. CoreWeave arbeitet auch am Speicherpfad rund um diese Beschleuniger, denn schnellere Rechenleistung bietet weniger Nutzen, wenn Rechenaufgaben wegen Datenbewegungen immer wieder ins Stocken geraten.

Worauf zu achten ist

Zu beobachten sind Kundenimplementierungen, die Angaben zur reservierten Rubin-Kapazität und zur Leistung bei konkret benannten Workloads offenlegen. Die Speicherergebnisse sollten die Latenz regionenübergreifender Schreibvorgänge, die Replikationsdauer und die Preise der neuen Speicherklasse Archive ausweisen. Diese Kennzahlen würden zeigen, ob die Speicheränderungen parallel zur Zunahme der verfügbaren Rechenkapazität Wartezeiten und Kosten senken.