• CoreWeave 启动了一个多机架 NVIDIA Vera Rubin NVL72 集群,通过 Spectrum-X Ethernet 连接数百个 Rubin GPU
  • 公司还为 AI Object Storage 增加了跨区域写入加速功能和 Archive 存储层

事实

CoreWeave 9 月 16 日表示,公司已在 CoreWeave Cloud 上启动一个多机架 NVIDIA Vera Rubin NVL72 集群,通过 NVIDIA Spectrum-X Ethernet 连接数百个 Rubin GPU。每个 NVL72 机架集成 72 个 Rubin GPU 和 36 个 Vera CPU,并配备 NVLink 6、ConnectX-9 SuperNICs 和 BlueField-4 DPUs。

CoreWeave 还宣布了 AI Object Storage 的两项调整。跨区域写入加速使应用可以先在本地完成写入,同时继续在后台向另一区域复制数据。新的 Archive 存储层面向需要保留但访问频率较低的数据。

公司还介绍了系统投入生产前的自动化机架验证,涵盖硬件检测、固件、电力、冷却和工作负载测试。公司没有披露已部署的 Rubin 集群数量、GPU 总可用容量,也没有披露客户目前可以预留多少容量。

评估

将数百个 GPU 纳入一个集群,可以增加客户可投入某项工作负载的算力,但只有当数据能够足够快地送达时,这些算力才有用。训练、推理和智能体应用可能反复读取、写入和移动大型数据集,因此存储和网络延迟可能让昂贵的加速器处于等待状态。

跨区域写入加速改变了这条路径中的一个环节。工作负载无需等待远端副本完成,就能结束本地写入,之后由 CoreWeave 处理复制。这可以减少应用等待跨区域存储的时间,不过客户仍需了解第二份副本何时可用,以及存储在何处。

因此,对 BTW 读者而言,Rubin 公告不只是一个 GPU 里程碑。CoreWeave 也在改进这些加速器周边的存储路径,因为当任务反复因数据移动而停顿时,更快的计算带来的价值会降低。

关注事项

关注那些披露已预留 Rubin 容量,并提供具体工作负载性能数据的客户部署。存储结果应包括跨区域写入延迟、复制时间,以及新 Archive 存储层的定价。这些数据将有助于判断,在可用算力增加的同时,存储调整是否也减少了等待时间和成本。