摘要
- CoreWeave 的网络堆栈覆盖纵向扩展、横向扩展、存储、租户、管理、骨干网和专用连接;它是一个运营架构,而非独立产品。
- NVIDIA 的网络和 DPU 与 CoreWeave 的软件结合,用于调度加速器、隔离租户以及在专业云中移动数据。
- CoreWeave 报告了 43 个数据中心、超过 850 MW 的活跃电力和约 3.1 GW 的合同容量;微软贡献了 2025 年收入的 67%,显示了规模和集中度。
- 考验在于将合同电力和客户组合转化为可靠、多样化的服务,赶在融资、租赁、硬件过时和运营复杂性堆积之前。
物理足迹的增长速度超过了传统区域地图所显示的范围
截至 2025 年 12 月 31 日,CoreWeave 报告了 43 个数据中心,活跃电力超过 850 MW,合同容量约 3.1 GW。活跃数据描述的是该日期根据其定义下运行的设施;合同数据则代表未来权利和承诺,并非已安装容量。
增长速度十分迅猛:2023 年底时拥有 10 个数据中心和约 70 MW;2024 年底达到 32 个数据中心和超过 360 MW;2025 年底更是达到 43 个数据中心和超过 850 MW。2026 年第一季度,活跃电力突破 1 GW,合同容量超过 3.5 GW。这些数字不仅体现了快速工业化,也说明了昨日的架构如何迅速成为少数。
电力是前提条件,而非成品。一个合同兆瓦还需要互联、发电或电网、高密度配电、冷却、建筑、网络、加速器交付和运营验收。任何一个环节的延迟都可能推迟收入,而某些费用却可能提前发生。
数据中心模式是混合的。CoreWeave 拥有设备并控制关键部署,但也使用租赁设施和第三方服务。这加快了扩张步伐,不必自建每一栋建筑,但这也使得房东履约、施工、电力和合同条款成为了可靠性的组成部分。
一块 GPU 还不是一朵云
一个安装在机架中并接通电源的加速器可以运行代码,但仅凭它自己,无法提供客户从云上购买的服务。一个训练任务需要大量加速器表现得就像单个分配单元。数据必须以合适的速率从存储中送入。集合通信操作必须跨 GPU 执行,不能让任务大部分时间都在等待通信。租户必须保持隔离。调度器需要知道哪些节点、链路和设备是健康的。检查点必须能在故障中存活。工程师需要一条通往环境的路径,而用户则需要另一条通往其他云、办公室和外部服务的路径。云产品始于这些路径变得可重复之时。
因此,AI 云的网络不能被当作计算的附属品。在普通企业架构中,网络常被描述为连接服务器的系统。但在分布式 AI 中,它直接参与有效计算。一个同步任务可能因一根光纤劣化、一个加速器变慢、一条通道拥塞或存储路径跟不上节奏而受限。在任务等待时,闲置硬件的账单仍在继续。因此,网络不仅影响基准测试,还影响着每一个由资金支撑的 GPU 小时的经济性。
CoreWeave 的平台是一个很好的研究对象,因为它让这种关系变得可见。该公司专注于加速器基础设施,而不是将 GPU 作为通用云中的一种次级服务来提供。它的公开资料以比简单的实例目录更详细的方式描述了机架网络结构、数据处理单元、裸金属编排、托管超级计算机、专用连接和运营修复。这些文件证明了设计意图和产品架构,但并未构成每处设施、每代产品或每次客户部署的完整地图。
问题并非 CoreWeave 在抽象意义上是否拥有“高速网络”。有价值的问题是:在一个 AI 工作负载能够作为可靠服务运行之前,有多少张不同的网络必须协同工作,以及每一张网络由谁控制。
“CoreWeave 网络堆栈”究竟意味着什么
这一表述是一个编辑上的总称,并非法律实体,也不是单独销售的商品编号(SKU)。法律和运营实体是 CoreWeave, Inc.,一家特拉华州公司,总部位于新泽西州利文斯顿,在纳斯达克上市,股票代码为 CRWV。网络堆栈位于 CoreWeave Cloud Platform 内部,该平台还包括计算、存储、编排和托管服务。
不同的名称描述了不同的层。Nimbus 是 CoreWeave 基于 DPU 的虚拟网络架构。CoreWeave Kubernetes Service(简称 CKS)在裸金属上提供托管 Kubernetes。SUNK 将基础设施和运营打包为托管超级计算机服务。Mission Control 增加了监控、修复和生命周期管理。Direct Connect 为客户提供专用连接。NVLink、NVSwitch、Quantum、Spectrum-X 和 BlueField 是 NVIDIA 的技术,由 CoreWeave 集成,并非该公司自己的发明。
区分这些层可以避免两种常见错误。第一种是将平台上的每个协议或设备都归功于该公司。CoreWeave 的贡献在于围绕供应商技术进行系统集成、验证、运营和云软件。第二种是想象有一种统一的网络结构,从每块 GPU 直达每位客户。本地的纵向扩展链路、跨机架的训练网络、存储网络、VPC 覆盖、管理路由和跨大西洋骨干网有着不同的目标、时延预算和故障域。它们不能用一个带宽数字来概括。
同样的原则也适用于所有权。CoreWeave 部署和运营着大量设备,但其文件也描述了租赁、第三方数据中心、电力承诺、光纤供应商关系和设备融资。一项服务可以在运营上进行集成,而公司并不拥有建筑物、电力公司、长途路由或机架中的每个组件。“垂直整合”只有在意味着对多个层面进行协调控制时才有意义,而不是完全的自给自足。
从 Atlantic Crypto 到专业计算
CoreWeave 成立于 2017 年,当时名为 The Atlantic Crypto Corporation。其早期业务使用 GPU 进行加密货币工作负载,并于 2018 年 9 月从有限责任公司转为特拉华州公司。随着转向专业云计算,它于 2019 年 12 月采用了 CoreWeave 这个名称。
其起源有时被简化为加密货币挖矿与人工智能之间的鲜明对比。更重要的连续性在于运营。这两种业务都需要购买加速器、确保电力供应、维护高密度硬件,并将工作负载引导至未被充分利用的容量。该公司在构建多租户、网络、存储和支持系统之前,先了解了加速器舰队的经济性。
这种区别很重要,因为需求的转变并不会自动创建出一个平台。挖矿工作负载可能相对重复,并能容忍简单的资产生命周期模型。视效、机器学习和高性能计算则需要不同的软件、数据移动、隔离和服务保证。CoreWeave 必须添加那些能让外部客户信任其无法拥有且无法物理检查的资源的层。
在 2020 年代初期,该公司开发了专业的计算、存储和 Kubernetes 服务。裸金属上的 Kubernetes 成为了主要界面:客户可以将容器化工作负载直接调度到带有加速器的服务器上,而无需先经过传统的虚拟机层。到 2023 年底,CoreWeave 运营着 10 个数据中心和约 70 MW 的活跃电力。到 2024 年底,它报告拥有 32 个数据中心和超过 360 MW。
扩张改变了网络问题的性质。一个拥有十处设施的运营商可以高度依赖专家知识,并容忍本地的例外情况。一个拥有三十或四十处设施的云则需要可重复的设计、软件定义的策略、共同的验证、共享的监控,以及一种在不丧失运营一致性的情况下让客户跨硬件代际迁移的方式。规模将良好的工程决策变成了治理问题:谁批准变更,例外情况被检测到的速度有多快,以及每个新设施是否再现了预期的控制边界。
CoreWeave 于 2025 年 3 月完成了首次公开募股。上市不仅增加了资本。它还产生了一份招股说明书和 SEC 文件,其中提供了关于设施、客户集中度、债务、租赁、互联架构以及风险的证据。这份记录使得能够同时将网络堆栈作为技术系统和上市公司的承诺来研究。
决定架构的工作负载
大型模型的训练将计算分布在加速器之间,并反复交换部分结果。确切的模式取决于模型架构、并行化方法和软件,但基础设施问题是稳定的:分配的有效速度取决于集合通信以及本地计算。一个在聚合指标上看起来很快的网络结构,如果拥塞、拓扑或尾部时延减缓了将工作维系在一起的同步点,就可能浪费容量。
该堆栈还必须服务于行为不像集合通信的流量。数据集流入环境。检查点离开 GPU 内存并到达存储。控制系统分配工作负载和策略。工程师获取日志。服务暴露推理端点。副本和复制可能跨区域发生。每一类流量对延迟和丢失都有不同的容忍度。将所有流量视为一个无差别的网络,会使预测性能和隔离故障变得困难。
因此,设计是分层的。纵向扩展链路在机架规模的系统内部创建一个紧密耦合的域。横向扩展网络将多个系统跨机架连接起来。存储路径为工作负载提供供给和保存。租户网络提供私有地址和策略。管理网络让运营商能够控制主机、DPU、交换机以及修复。骨干网连接设施和外部生态系统。客户专用电路将云连接到其他管理域。
这些层会相互作用,但不可互换。长途光纤不能替代本地 GPU 网络结构,因为传播延迟会阻碍远程站点之间高度同步的训练。NVLink 域不是客户 VPC。覆盖网络可以隐藏地址差异,但不能修复底层中一根损坏的光纤。Kubernetes 可以在不理解每条通道的情况下调度一个 pod,除非平台为其提供拓扑信息和设备集成。
因此,该架构是一条转化意图的链条。客户请求一个集群、命名空间、网络或作业。CoreWeave 的控制系统将请求转化为可用的服务器、网络结构、存储和策略。Nimbus 将 VPC 意图转化为 DPU 状态和底层配置。Kubernetes 和与 Slurm 相关的服务将作业意图转化为节点和加速器。Mission Control 将健康信号转化为修复操作。客户看到的是服务;平台必须保持所有转化的一致。
机架规模域内的纵向扩展网络
纵向扩展网络在一个紧密集成的系统内部连接加速器。在 NVIDIA 的机架规模设计中,NVLink 提供 GPU 之间的高带宽通信,NVSwitch 在本地域内提供交换。CoreWeave 在选定的系统和代际中集成了这两种技术。
关键属性不是品牌,而是邻近性。纵向扩展域允许模型分片和集合通信交换数据,而无需在每个步骤都穿越普通的数据中心网络。这样,一个机架可以表现得像一个大型加速器系统,而不是一组独立服务器。它也创建了自己的故障域:机架内的一个交换机、电缆、冷却问题或故障组件可能会影响调度器希望一起使用的许多 GPU。
CoreWeave 的招股说明书描述了选定配置中高达每秒 3,200 Gbps 的无阻塞 GPU 互连带宽。“选定配置”是关键限定条件。它并不建立通用服务等级,也不描述所有数据中心或代际。工作负载的实际有效带宽还取决于软件、拓扑、消息模式和整个路径的健康状况。
纵向扩展减少了一个瓶颈,同时使其他层的密度增加。更多的加速器和更高的本地带宽会增加机架的电力、冷却和维修要求。一个集中计算而没有相应热工和运营设计的系统,可能更难维修,或者将瓶颈转移到横向扩展和存储上。该架构必须被理解为一种平衡,而非一系列最大规格。
横向扩展网络:InfiniBand 与以太网共存
当一个作业离开纵向扩展域时,它便进入横向扩展网络。CoreWeave 的文档描述了 NVIDIA Quantum-2 InfiniBand、800 Gbps 的 Quantum-X800 XDR,以及支持 RoCE 和 RDMA 的 Spectrum-X 以太网。同时存在 InfiniBand 和以太网意义重大:该平台并未将自己的身份简化为单一的协议家族。
用于紧密耦合集群的 InfiniBand
InfiniBand 专为面向远程直接内存访问的低延迟通信而构建,并在 HPC 领域拥有悠久历史。在 AI 集群中,它可以绕过部分常规 CPU 处理,在加速器主机之间移动数据。NVIDIA 的 Quantum 系统增加了面向集合通信的交换和能力。CoreWeave 将这些网络结构集成到集群产品中,而非将 InfiniBand 作为单独的运营商服务出售。
公开证据并未揭示所有拓扑、超额订阅比率、路由策略或服务限制。“无阻塞”可以描述一个特定设计,而非整个舰队。即便一个设计精良的网络结构,也可能受到光纤劣化、放置不佳、流量不均或产生热点的软件影响。购买者应当询问他们获得的集群对应哪一代、何种拓扑和验证流程。
Spectrum-X 和 RoCE 作为以太网路径
Spectrum-X 是 NVIDIA 面向 AI 的以太网网络平台。RoCE 通过以太网传输 RDMA 语义,使得应用程序能够使用直接内存访问,而运营商保留一个以太网结构。使用 Spectrum-X 为 CoreWeave 针对在该生态系统内构建的工作负载和代际提供了一条替代性的横向扩展路径。
以太网的普及并不意味着操作简单。RoCE 的性能取决于拥塞控制、队列设计、丢包行为、遥测以及端到端配置。一个网络可以使用熟悉的以太网帧,但需要专门的工程来避免队头阻塞、多对一拥塞或集合通信的不稳定性。集成云承担了其中大量的调优工作,但客户失去了对这些决策的直接可见性。
基于通道优化的拓扑和放置
多通道系统将相应的网卡和加速器分组,使得集合通信流量沿着可预测的并行路径传输。一个通道优化的设计可以减少不必要的交叉并规整带宽。它也要求调度器理解拓扑:在错误的节点组合上分布工作负载,可能会使物理设计失效。
通道还会集中故障。如果一条通道性能下降,每个使用该路径的节点都可能成为拖后腿者,即使其他接口仍保持健康。操作系统必须区分故障服务器和共享网络问题。这就是拓扑遥测、验证和修复与标称端口速度同样重要的原因。
Nimbus 将云边界移至 DPU
高性能网络结构本身并不能创建一个多租户云。客户需要私有地址、路由控制、互联网访问和隔离。CoreWeave 通过 Nimbus 来应对,这是一种将 VPC 功能卸载到数据处理单元的虚拟网络架构。文档指出使用了 NVIDIA BlueField-3 DPU,并描述了 VRF、VXLAN 和 EVPN 类型 5 路由。
DPU 占据着客户控制的计算与供应商控制的基础设施之间的特权位置。它可以处理虚拟流量、实施分段,并为工作负载保留 CPU 资源。它还可以将租户边界保留在客户控制的操作系统之外。这种分离既是性能决策,也是安全决策。
VPC 覆盖如何构建
一个 VRF 实例将一个路由域与另一个隔离开。VXLAN 通过共享的物理底层承载租户分段。EVPN 分发可达性信息,类型 5 路由可以通告 IP 前缀,而不仅仅是 MAC 地址。这些机制共同使 CoreWeave 能够在公共基础设施上呈现一个私有网络。
覆盖网络并未消除对底层的依赖。如果物理连接中断,虚拟网络也会中断。如果路由分发出现错误,在大规模场景下隔离或可达性可能被打破。如果 DPU 镜像或策略系统包含错误,许多主机可能迅速接收到相同的错误状态。抽象化通过将复杂性转移给供应商而简化了客户体验,并未消除复杂性。
DPU 进入信任基础
Nimbus 减少了供应商网络功能在客户主机上的暴露,但增加了对 DPU 固件、安全启动、密钥、策略分发、日志和恢复的依赖。一个实施隔离的设备必须可观测且可更新,而不成为通往租户环境的一条不受控制的路径。
控制边界也影响着事件响应。一次连接失败可能源自工作负载、Kubernetes 策略、VPC 配置、DPU 软件、EVPN 控制或物理网络。支持团队需要能够跨层追踪的证据,同时不暴露租户信息。文档解释了预期的架构,但并未发布独立的舰队范围内隔离故障或修复时间的历史记录。
裸金属 Kubernetes 作为客户控制平面
CoreWeave Kubernetes Service 在裸金属基础设施上提供托管 Kubernetes。该设计避免了在容器与 GPU 服务器之间插入一层传统的虚拟机优先层。每个集群获得自己的 VPC,并为分布式工作负载集成高性能网络和存储。
裸金属消除了一层,但并未完全简化系统。Kubernetes 必须发现 GPU、暴露设备、应用配额、放置 Pod,并与网络和存储插件交互。平台协调镜像、驱动、固件、容器运行时和集群更新与硬件代际的关系。客户获得了一个熟悉的 API,而 CoreWeave 继承了一个要求严苛的兼容性矩阵。
Kubernetes 能决定什么,不能决定什么
Kubernetes 可以根据调度器持有的信息和策略来决定在何处运行一个 Pod。它并不自动理解每条通道、光纤、交换机路径或集合通信状况。CoreWeave 必须添加插件、操作器、拓扑信息和控制机制,以便逻辑决策对应到可行的物理分配。
网络策略也有边界。Kubernetes 策略限制工作负载之间的流量,而 VPC 和 DPU 提供更广泛的租户和路由边界。一个网络策略对象并不能证明数据包穿过了实施该意图的路径。配置、实施和观测必须保持一致。
SUNK 将集群变成托管超级计算机
SUNK 定位为面向生产环境的托管超级计算机服务。它结合了基础设施、高性能网络结构、工作负载编排和 CoreWeave 的运营,面向那些希望拥有大型专用环境而无需建设完整设施和运维团队的客户。
该服务改变了责任划分。客户保留模型架构、代码、数据和作业策略;CoreWeave 承担更多的硬件生命周期、验证和事件处理。其结果更像是通过云合同和软件交付的托管 HPC 设施,而非一组可互换的实例预订。
Mission Control 将运营转化为产品
Mission Control 增加了监控、维护、修复和生命周期管理。其重要性在任务巨大时显现。在一个小型池中更换一个组件可能影响有限;在一个同步分配中诊断一条劣化链路,则决定了成千上万个加速器小时是有效产出的,还是被浪费的。
服务资料描述了主动监控和干预。这确立了预期的模型,而非独立验证的正常运行时间或公开的修复时间分布。缺乏完整的事件普查很重要,因为可靠性是客户向供应商付费而非自行构建集群的一个关键原因。
存储是互联计算的一部分
训练数据、检查点和工件沿着可能限制整个工作负载的存储路径传输。一个拥有卓越 GPU 带宽的集群,如果无法足够快地读入输入、写入检查点或恢复状态,就可能停顿。该平台包含对象和文件存储,并将高性能数据移动作为服务的一部分来描述。
检查点流量创造了一个特定模式。许多工作进程可能协调一致地持久化状态,产生与集合通信不同的突发流量。如果存储与训练网络共享物理资源,该设计就需要隔离或容量。如果它使用另一张网络,平台仍需协调两个路径之间的故障和恢复。
存储也会影响可移植性。将模型迁入 CoreWeave 可能需要从另一个云或私有环境进行大规模传输。迁出也可能带来成本、时间和合同摩擦。“零出口迁移”是一项商业机制,旨在降低向 CoreWeave 迁移的某些成本;它不是一项技术保证、通用免费出口,也不是数据移动无运营成本的证明。
客户应要求提供端到端证据。加速器或网络结构基准测试很有用,但生产环境中包含数据准备、检查点、模型日志、日志和恢复。一项隔离单层的测试无法回答完成实际工作需要多长时间、成本多高。
骨干网连接区域,而非单一的同步超级计算机
CoreWeave 描述了一张运营商级别的骨干网,通过陆地和海底光缆、直接对等互联和专用服务连接北美和欧洲的数据中心。文件列出了 10 Gbps、100 Gbps 和 400 Gbps 的 Direct Connect,并受位置和可用性限制。
骨干网的功能不同于本地横向扩展网络。它跨区域移动数据集、副本、检查点、控制信息和推理流量;连接用户和其他云;并支持恢复和分发。长途延迟使其无法将远程数据中心合并为一张用于耦合作业的低延迟训练网络。
专用连接减少了一类不确定性
一条专用电路避免了公共互联网的部分波动,并提供了更清晰的容量和支持边界。它并不创建完全端到端的私有世界。接入可能依赖于一家运营商、一条交叉连接和数据中心运营商。云接入点有其自身的验证要求。并非所有位置的物理所有权或路径多样性都被披露。
因此,不应将 CoreWeave 描述为 Tier 1 运营商。它运营着一张骨干网并进行对等互联,但证据并未证明其拥有全球无结算的覆盖范围或全部光纤的所有权。其优势在于能够集成接入其自己的计算容量,而非取代全球电信生态系统。
区域设计创造了可用性决策
截至 2025 年底,CoreWeave 报告在六个国家拥有设施。这个数量并不意味着每代产品、网络结构、服务或专用速度在每个国家都可用。区域是分阶段开放的,因为电力、冷却、网络、硬件和运营准备并非同时就绪。
地理位置的影响不仅限于延迟:数据治理、与其他云的邻近性、人员、电力来源、故障关联性以及谁控制本地路径。对于 CoreWeave 而言,每个国家在容量之外还增加了法律、公用事业和供应链方面的协调工作。扩张是一种运营模式,而非一张相同盒子的地图。
可靠性将资本转化为有用时间
无论作业正在推进还是在等待,硬件仍处于融资状态。这就是可靠性是一项财务变量的原因。一次网络故障、GPU 降级、存储阻塞或调度器错误都会减少有收益且可计费的产出,而同时利息、租赁和电力仍在继续。
拖后腿者比完全故障更重要
一个死掉的节点很显眼。一个拖后腿者可能仍然活着,却在每次同步时拖慢整体。大型作业需要能够检测降级的遥测,而不仅仅是二元健康状态。调度器和运维必须决定是排空、替换还是继续使用该组件。
公开信息并未提供完整的作业故障、尾部延迟或拖后腿者发生率分布。这并不证明可靠性差,但限制了独立比较。客户必须依赖合同、负载测试和自身证据,而不是从图表中推断。
验证是系统测试
在暴露一个集群之前,CoreWeave 必须将服务器、交换机、光纤、电缆、固件、驱动、存储和编排作为一个整体进行验证。一次成功的开机并不足够。有效的测试应检查拓扑是否支持工作负载、能否承受故障、以及在修复时是否不会产生不一致。
验证会随时间变化。在一个软件集合下经过测试的设计,在更新后可能表现不同。NVIDIA 代际的快速涌入增加了组合的数量,而旧环境仍在合同期内。成熟度在于管理这种重叠,而不将每处设施变成唯一的例外。
财务是架构的一层
CoreWeave 报告 2025 年收入 51 亿美元,净亏损 12 亿美元。它为财产和设备支付了 103 亿美元现金。年末剩余履约义务为 607 亿美元。文件还描述了非常可观的设备融资、债务、租赁和基础设施承诺。
这些数字含义不同。收入是已确认的服务。为资产支付的现金是一项投资流出,而非整个舰队的估值。亏损表明增长并未产生合并利润。剩余履约义务是根据会计准则反映的已签约未来业绩,并非可用现金或已交付服务。
2026 年第一季度显示了需求和拖累成本
截至 2026 年 3 月 31 日的季度,CoreWeave 报告收入 20.78 亿美元,亏损 7.4 亿美元,利息支出 5.36 亿美元。它还根据其定义报告了 994 亿美元的积压订单。这些数据同时显示了可见的需求和沉重的融资负担。
积压订单与年末剩余履约义务不可直接互换;定义和日期不同。两者均表明未来需求,但将其转化需要使数据中心、电力、硬件和网络投入运行,然后执行合同。积压订单越具说服力,附带的交付义务也越大。
由 GPU 支持的融资使资产与合同对齐
CoreWeave 使用了担保贷款、设备融资和客户支持的结构。2026 年 6 月,它宣布了一项 85 亿美元的融资工具,被描述为由 GPU 支持,且该交易获得投资级评级。它增加了部署能力;它不是收入,也不意味着所有公司债务均具有该评级。
资产融资可以使债务、硬件和合同流对齐。它也会对抵押品、部署和现金使用施加限制。与传统基础设施相比,加速器、交换机和光纤老化更快。如果利用率保持高位且合同覆盖设备最高经济价值的时期,该模式方可奏效。
因此,网络设计会影响信用质量。一项提升利用率的拓扑结构会提高融资资产的产出。一处延迟的数据中心、持续存在的拖后腿者或一次失败的迁移则会降低产出。在 CoreWeave,系统工程和资产负债表工程是同一个故事。
客户集中度也是基础设施依赖
微软占 2025 年收入的 67%。一个锚定客户可以证明容量投资的合理性、支持融资,并给予提前购买的信心。同样的集中度赋予了它谈判筹码,并使利用率依赖于单一关系。
CoreWeave 已宣布或报告了与 Meta 和 Anthropic 的关系;Flow Traders 于 2026 年 7 月选择其训练基础模型,Leidos 宣布在国防、国家安全和情报 AI 方面开展合作。这些公告证明了在所述层面上的合同、选择或合作。它们并未证明集中度已经消失,或所有容量均已激活。
照付不议合同转移风险,而非消除风险
多年的照付不议合同提供了可见性,并可支持融资。它们将部分利用率风险转移给客户,因为承诺付款并不仅仅取决于即时消费。它们并未消除建设、电力、交付、性能、信用或重新谈判风险。
对于客户而言,合同投入了部分云承诺。传统公有云强调弹性和低承诺。一个专用集群可能需要更长久的合作关系,因为供应商正在建设或预留特定容量。界面看起来像云软件,而底层结构类似于项目融资。
国防与监管提高了保障门槛
2026 年 7 月 30 日与 Leidos 的合作将平台带向国防和情报任务。这并未证明所有必需的授权、认证或实施均已到位。它确实表明安全性、供应链、可审计性和连续性可能在产品中占据更重要的分量。
由 DPU 实施的 VPC、专用连接和托管运营支持高安全设计。它们不能替代项目控制、人员要求、数据处理或政府批准。工作负载越敏感,责任边界就需要越透明。
收购向上游扩展,而失败的合并则指向下游
2025 年间,CoreWeave 收购了 Weights & Biases、OpenPipe、marimo 和 Monolith AI。Weights & Biases 增加了模型开发和可观测性;其他公司拓展了推理、笔记本工具和工业 AI 能力。这些交易将 CoreWeave 从原始基础设施向开发周期的更多阶段提升。
逻辑很清楚。一个理解模型工作流的供应商可以预见需求、简化消耗并留住客户。风险也存在:软件有着与融资数据中心不同的周期、利润和文化。如果 CoreWeave 试图拥有原本独立的工具,与合作伙伴的重叠和冲突可能出现。
收购 Core Scientific 的提议方向则相反。CoreWeave 于 2025 年 7 月宣布了一项协议,这将增强其对数据中心产能和租赁的控制。在股东投票后,Core Scientific 于 2025 年 10 月 30 日终止了该协议。CoreWeave 并未收购该公司。
综合来看,这些交易揭示了向上游软件和向下游物理产能的整合。失败的合并证明,基础设施控制并非总能按照平台期望的节奏购买。股东、监管、融资和合同可能会阻止垂直整合的技术逻辑。
CoreWeave 控制什么,什么在外部
CoreWeave 控制着客户平台、许多设计决策、验证、编排和运营。它决定 Nimbus 如何呈现 VPC、如何展现集群、管理什么以及如何响应事件。它可以提前购买硬件,并围绕高密度设计设施。
NVIDIA 控制着关键的 GPU、NVLink、InfiniBand、Spectrum-X 和 BlueField 路线图。公用事业和数据中心合作伙伴控制着部分电力和交付。运营商、交换中心和云服务商控制着部分外部连接。贷款人限制着资本。大客户通过合同施加影响。
这不是独家缺陷:每个云都依赖供应商。集中度之所以重要,是因为 CoreWeave 的差异化与 NVIDIA 的早期部署紧密挂钩,且其承诺相对于其运营历史极为庞大。路线图延迟或变化可能会传导至客户和融资。
优势在于协调这些边界。风险在于相关依赖性:一代产品、数据中心设计或客户计划可能会影响多个层面。整合减少了客户的合约数量,但放大了供应商故障的影响。
竞争地位:专业云分担责任
CoreWeave 与超大规模云服务商、其他 GPU 云、私有集群以及托管、主机代管和集成商的组合展开竞争。仅计算 GPU 数量或查看一项基准测试是不够的。购买者比较的是代际、网络结构、存储、调度、专用连接、支持、合同、地理位置以及数据移动成本。
对比超大规模云服务商
AWS、Microsoft Azure、Google Cloud 和 Oracle 提供广度、全球生态系统和庞大的资产负债表。它们将 AI 与数据库、安全、分析和已有的采购结合起来。CoreWeave 以专业化回应:快速集成选定的 NVIDIA 代际、裸金属以及针对高密度优化的设计。
专业化减少了抽象并加快了验证,但形成了一个更窄的供应商和故障画像。客户获得了一个专注于工作负载的供应商,接受较窄的广度和更年轻的资本结构。正确的比较是针对具体工作负载的。
对比其他专业云
Lambda、Nebius、Crusoe 和其他供应商在加速器、集群和管理方面存在重叠。它们在地理、能源、软件、所有权、资本和设施控制方面存在差异。“新云”是一个标签,而非一种架构。
CoreWeave 的公开文件提供了关于规模和风险的不寻常证据,但并未证明技术或经济优越性。一个信息较少的竞争对手可能更小、更高效或单纯不透明。透明度不应变成排名。
对比自行构建集群
一个私有集群提供对硬件、数据和运营的直接控制,但需要采购、电力、设施、网络、存储、安全、固件、备件和专业人员。CoreWeave 出售的是转移掉其中大部分负担。
这种转移并非完全。客户设计工作负载、管理数据、设定策略并评估风险。长期承诺降低了流动性。一个私有集群面临利用率不足的风险;一份云合同则面临依赖性。经济决策在于谁能更好地吸收波动,并保持昂贵系统的生产力。
液冷交换显示下一个瓶颈可能在哪里移动
2026 年 7 月,CoreWeave 描述了用于提升每机架带宽的液冷交换。该数字来自其架构和计算,而非对整个舰队的独立测试。其机制之所以重要,是因为随着加速器密度增长,交换机和光纤消耗的电力与产生热量足以限制机架。
液冷交换机允许在给定空间内实现更高的容量,并可能缩短线缆路径。它也将网络维护与液压系统耦合起来。一处泄漏、泵问题或维修流程可能会影响原本被视为风冷网络设备的资产。
这一变化显示了瓶颈如何迁移。更快的 GPU 要求更强的纵向扩展;后者要求高密度的横向扩展;密度要求更高的电力与冷却;设施需要不同的机电设计。一代产品可能意味着一座数据中心的改造,而非一次服务器升级。
Vera Rubin 是未来的过渡,而非当前舰队
2026 年 7 月的资料描述了为 NVIDIA Vera Rubin NVL72 所做的准备工作,并针对 Blackwell 在每兆瓦 token 数方面做出了经过衡量或前瞻性的声明。这些应归功于 CoreWeave 和该配置。并未证明在整个舰队中、在研究截止日时的可用性。
新一代产品会改变加速器、纵向扩展、横向扩展、电力、冷却、固件、驱动、编排和验证。它可以改善每 MW 的产出,并使旧设施竞争力下降。只有当 CoreWeave 管理好迁移、利用率和先前签约资产的折旧时,早期采用才是一种优势。
它也加深了对 NVIDIA 的依赖。早期获取吸引客户和合同,但暴露于供应商的时间表、定价和架构之下。客户或软件的多元化未必使物理层实现多元化。
对更广泛数字基础设施的影响
其扩张所触及的远不止 GPU 租赁。吉瓦级承诺推动了对发电、电网、变压器、冷却、土地和建筑的需求。高密度网络结构需要交换机、光纤和光缆。专用连接需要运营商、交换中心和接入点。融资需要能够对快速老化的技术资产进行估值以匹配长期合同的贷款人。
该平台改变了流量出现的位置。耦合训练停留在本地网络结构上,而数据集、检查点、工件、推理和工作流则在云、数据中心和用户之间流动。可见的影响可能不是来自一股巨大的训练流,而是来自其周围持续不断的移动。
对于社区和电网而言,该堆栈是一份电力与土地决策书。文件并未提供公司级的环境结论,但确立了活跃和签约电力是核心指标,且延迟是风险。
对于工程师来说,该架构表明 AI 基础设施正成为一门独立的学科。路由与交换同集合通信库、加速器拓扑、液冷、调度以及项目融资交织在一起。调试拥塞的人保护着工作负载和偿债能力。
公开证据未显示的内容
CoreWeave 发布了文档、博客和公开文件,但该堆栈在部分方面仍不透明。所提供的资料中不包含完整的拓扑图、各中心的网络结构清单、超额订阅表格、光纤所有权地图、完整的事件历史记录或按工作负载分类的独立基准测试档案。
这一局限性应当约束断言。文档证明了机制;SEC 文件证明了财务和风险;一项公告证明了选择或合作。这些均不能证明普遍适用性、舰队正常运行时间或对每位购买者而言更低的总成本。
同样的谨慎适用于规模。活跃电力不是签约电力。积压订单不是收入。一个计划日期不是结果。一项宣布的协议不是活跃使用。一项提议的收购不是所有权。未来的代际不是当前的舰队。
这些区别并未削弱其形象:它们定义了专业读者必须管理的差距。CoreWeave 要求客户和资本信任一个其最有价值细节仍属私有的集成系统。理性的反应不是假设卓越或失败,而是要求提供针对特定合同、集群和设施的证据。
核心判断
CoreWeave 的产品常被称为计算容量。更深层的产品是协调:路线图与建设、纵向扩展与横向扩展、DPU 与租户意图、Kubernetes 与拓扑、存储与检查点、骨干网与接入、长期融资与短代际之间的协调。
协调可以创造真正的优势。一家专业供应商对整条链路做出决策,而非要求客户拼凑部件。它可以比许多企业更快地验证、修复和引入代际产品。增长表明大客户看重这种转移。
整合会集中后果。一项设计、延迟、策略错误、融资限制或客户变化可能波及系统的很大一部分。未来并不取决于某个带宽数字,而取决于所有层能否将融资容量转化为可靠工作负载。
会员简报
档案背景详情
使用相应会员等级登录,即可解锁完整简报与来源注释。
仅限 Strategic Circle
Strategic Circle
所有读者均可浏览。加入并登录后可解锁档案简报。
加入 Strategic Circle仅限 Leadership Alliance
Leadership Alliance
符合条件的 IP 资产所有者和管理层可登录查看 Leadership Alliance 简报。
加入 Leadership Alliance
