概要
- CoreWeave のネットワークスタックは、スケールアップ、スケールアウト、ストレージ、テナント、管理、バックボーン、プライベート接続の各層に及び、別個の製品ではなく運用アーキテクチャである。
- NVIDIA ファブリックと DPU が CoreWeave のソフトウェアと組み合わさり、専門クラウド全体でアクセラレーターのスケジューリング、テナントの分離、データ移動を行う。
- CoreWeave は43のデータセンター、850 MW 超の稼働電力、約 3.1 GW の契約電力を報告。Microsoft が2025年の収益の67% を供給し、規模と集中の両方を示した。
- 試されるのは、資金調達コスト、リース、ハードウェアの陳腐化、運用の複雑さが蓄積する前に、契約電力とバックログを信頼性の高い多様化されたサービスへと変換できるかである。
物理的な資産は、通常のクラウドリージョンマップが示すよりも急速に拡大した
2025年12月31日時点で、CoreWeave は43のデータセンター、850 MW 超の稼働電力、約 3.1 GW の契約電力を報告した。稼働電力の数値は、当該日時点の同社の定義に基づく稼働中のインフラを示す。契約電力の数値は、将来の展開に向けた権利とコミットメントを示すものであり、設置済み容量として提示すべきではない。
進展は急激であった:2023年末には10のデータセンター、約70 MW の稼働電力;2024年末には32のデータセンター、360 MW 超;2025年末には43のデータセンター、850 MW 超。2026年第1四半期までに、CoreWeave は1 GW 超の稼働電力と3.5 GW 超の契約電力を報告した。これらの数字は、同社が設備と運用を産業的な速度で拡大しようとしていることを示す。また、昨日のアーキテクチャがいかに早くフリートの少数派になりうるかも示している。
電力は前提条件であり、完成品ではない。契約されたメガワットは、依然として相互接続、発電または系統供給、高密度配電、冷却、建屋の準備、ネットワーク経路、アクセラレーターの納入、運用受入を必要とする。どの一つの層での遅延も、一部の義務が先行して開始される中で収益を延期させうる。
データセンターのモデルは混在している。CoreWeave は機器を所有し、相当な展開を管理しているが、リースされた施設やサードパーティプロバイダーも利用している。これにより地理的な拡大を加速し、すべてのシェルを建設する必要を避けられる。しかし、大家のパフォーマンス、建設スケジュール、電力供給、契約条件もまた、プラットフォームの信頼性の一部となる。
GPU はそれだけでクラウドではない
通電されたラックに搭載されたアクセラレーターはコードを実行できるが、それだけでは顧客がクラウドから購入するものを提供しない。トレーニングチームは多数のアクセラレーターが一つの割り当てとして振る舞うことを必要とする。データはストレージから必要なレートで到着しなければならない。集合演算は、ジョブの大部分を通信待ちで費やさずに GPU 間を横断しなければならない。テナントは分離されていなければならない。スケジューラーはどのノード、リンク、デバイスが正常かを把握しなければならない。チェックポイントは障害後も生き残らなければならない。エンジニアは環境への経路を必要とし、ユーザーは他のクラウド、オフィス、サービスへの出口経路を必要とする。クラウド製品は、これらの経路が再現可能になったときに初めて始まる。
これが、AI クラウドにおけるネットワークがコンピュートの付属品として扱えない理由である。通常のエンタープライズアーキテクチャでは、ネットワーキングはサーバーを接続するシステムとして説明されることが多い。分散 AI では、ネットワークは実効的な計算に直接参加する。同期ジョブは、一つの劣化した光トランシーバ、一つの遅いアクセラレーター、一つの輻輳したレール、あるいはペースを維持できないストレージ経路によって遅延しうる。ジョブが待機している間も、遊休ハードウェアへの請求は続く。したがって、ネットワーク設計はベンチマーク性能だけでなく、融資を受けたすべての GPU 時間の経済性にも影響する。
CoreWeave のプラットフォームは、この関係を異常なほど明瞭に暴露するため、有用な主題である。同社は汎用クラウド内の小さなサービスの一つとして GPU を提供するのではなく、アクセラレーターインフラに特化している。そのため、同社の公開資料は、ラックファブリック、データプロセッシングユニット、ベアメタルオーケストレーション、マネージドスーパーコンピューター、プライベート接続、運用修理について、単純なインスタンスカタログよりも詳細に説明している。これらの記述は、設計意図と製品アーキテクチャの証拠である。すべてのサイト、すべての世代、すべての顧客展開の完全な地図ではない。
CoreWeave のネットワークが速いと言うのは抽象的すぎて役に立たない。関連する問いは、AI ワークロードが信頼できるサービスになるまでに、いくつの異なるネットワークが協調しなければならないか、そしてそれぞれを誰が制御しているかである。
「CoreWeave ネットワーキングスタック」が実際に指すもの
この言葉は編集上の包括的名称であり、法人格や別売りの SKU ではない。法的かつ経済的な運営主体は、デラウェア州法人で、ニュージャージー州リビングストンに本社を置き、Nasdaq にティッカー CRWV で上場している CoreWeave, Inc. である。ネットワーキングスタックは、コンピュート、ストレージ、オーケストレーション、マネージドサービスも含む、より広範な CoreWeave Cloud Platform の中に位置する。
複数の名称が異なるレイヤーを記述している。Nimbus は CoreWeave の DPU ベースの仮想ネットワークアーキテクチャである。CoreWeave Kubernetes Service(CKS)は、マネージドベアメタル Kubernetes を提供する。SUNK は、マネージドスーパーコンピューターサービスとしてインフラと運用をパッケージ化する。Mission Control は、監視、修理、ライフサイクルサポートを追加する。Direct Connect は、顧客へのプライベート接続を提供する。NVLink、NVSwitch、Quantum、Spectrum-X、BlueField といった NVIDIA の名称は、CoreWeave が発明したものではなく、CoreWeave が統合するサプライヤー技術を指す。
これらのレイヤーを分けておくことで、二つのよくある誤りを防げる。一つ目は、プラットフォーム内のすべてのプロトコルやデバイスを同社の功績とすることである。CoreWeave の貢献は、サプライヤー技術を中心としたシステム統合、適格性確認、運用、クラウドソフトウェアにある。二つ目は、すべての GPU からすべての顧客までを一つの均一なファブリックでつなぐことを想像することである。ローカルなスケールアップリンク、ラック間のトレーニングファブリック、ストレージネットワーク、VPC オーバーレイ、管理経路、大西洋横断バックボーンは、目的、遅延予算、障害ドメインが異なる。これらを一つの帯域幅の数字にまとめてはならない。
同じ規律が所有権にも当てはまる。CoreWeave は相当な機器を展開し運用しているが、同社の提出書類はリース、サードパーティデータセンター、電力コミットメント、光ファイバー関係、機器ファイナンスについても記述している。サービスは運用上統合されていても、同社が建物、電力会社、長距離ルート、またはラック内のすべてのコンポーネントを所有しているとは限らない。「垂直統合」という言葉は、完全な自給自足ではなく、多くのレイヤーにわたる調整された制御を意味する場合にのみ有用である。
Atlantic Crypto から特化型コンピュートへ
CoreWeave は 2017 年に The Atlantic Crypto Corporation として創業した。初期の事業は暗号通貨のワークロードに GPU 資産を使用し、同社は 2018 年 9 月に LLC からデラウェア州法人へ転換した。専門クラウドコンピュートへ向かうにつれて、2019 年 12 月に CoreWeave の名称を採用した。
この起源は時に、暗号通貨マイニングと人工知能の愉快な対比に矮小化される。より重要な連続性は運用面にある。どちらの事業でも、所有者はアクセラレーターを取得し、電力を確保し、高密度ハードウェアを稼働させ続け、ワークロードを遊休キャパシティへ誘導する必要がある。初期の会社は、クラウドのテナンシー、ネットワーキング、ストレージ、サポートシステムを構築する前に、アクセラレーターフリートの経済性を学んだ。
この区別が重要なのは、需要の転換が自動的にプラットフォームを生み出すわけではないからである。マイニングのワークロードは比較的反復的で、単純な資産モデルに寛容でありうる。ビジュアルエフェクト、機械学習、ハイパフォーマンスコンピューティングには、異なるソフトウェア、データ移動、分離、サービス保証が必要である。CoreWeave は、顧客が所有せず物理的に検査できないリソースを信頼できるようにするためのレイヤーを追加しなければならなかった。
2020 年代初頭、同社は特化型コンピュート、ストレージ、Kubernetes サービスを開発した。ベアメタル Kubernetes は際立ったインターフェースとなった。顧客は、従来の仮想マシン層を最初に経由することなく、アクセラレーターサーバー上で直接コンテナ化されたワークロードをスケジューリングできた。2023 年末までに、CoreWeave は 10 のデータセンターと約 70 MW の稼働電力を報告した。2024 年末までに、32 のデータセンターと 360 MW 超を報告した。
この拡大はネットワーク問題の性格を変えた。10 サイトの事業者は、依然として専門家の知識とローカルな例外に大きく依存できる。30 または 40 サイトのクラウドは、再現可能な設計、ソフトウェア制御のポリシー、共通の適格性確認、共有された監視、そして運用の一貫性を失わずに顧客をハードウェア世代間で移動させる方法を必要とする。規模は、優れた工学的選択をガバナンスの問いに変換する。すなわち、誰が変更を承認できるか、例外がどれだけ早く検出されるか、そして新しいサイトがすべて意図された制御境界を再現するかどうかである。
CoreWeave は 2025 年 3 月に新規株式公開を完了した。上場はエクイティキャピタルを追加する以上の意味を持った。それは、施設、顧客集中、負債、リース、相互接続アーキテクチャ、リスクに関する目論見書および SEC 証拠を生み出した。この記録により、ネットワーキングスタックを技術システムとしても、公開企業のコミットメントとしても研究することが可能になる。
アーキテクチャを決定づけるワークロード
大規模モデルのトレーニングは、計算をアクセラレーターに分割し、部分的な結果を繰り返し交換する。正確な通信パターンはモデルアーキテクチャ、並列化の方法、ソフトウェアに依存するが、インフラの問題は安定している。割り当ての有用な速度は、ローカルな計算と同様に、集合通信にも依存する。全体として高速に見えるファブリックも、輻輳、トポロジー、テールレイテンシーがジョブをつなぎとめる同期ポイントを鈍化させる場合、依然としてキャパシティを浪費しうる。
スタックは、集合通信のように振る舞わないトラフィックにも対応しなければならない。データセットが環境に入力される。チェックポイントは GPU メモリを離れストレージに着地する。制御システムはジョブとポリシーを配布する。エンジニアはログを取得する。サービスは推論エンドポイントを公開する。バックアップとレプリカはリージョンを跨ぎうる。各クラスは遅延と損失に対する許容度が異なる。これらすべてを一つの未分化なネットワークとして扱うことは、性能の予測を難しくし、障害の切り分けを困難にする。
これにより階層化された設計が生まれる。スケールアップリンクはラックスケールシステム内の密結合ドメインを作る。スケールアウトファブリックはラックを跨いで多くのシステムを接続する。ストレージ経路はワークロードに供給し持続させる。テナントネットワークは顧客にプライベートなアドレッシングとポリシーを提供する。管理ネットワークは運用者にホスト、DPU、スイッチ、修復ワークフローの制御を提供する。バックボーンは施設と外部エコシステムを接続する。顧客プライベート回線はクラウドを他者の管理ドメインへ接続する。
これらのレイヤーは相互作用するが、置き換え可能ではない。長距離ファイバーは、伝播遅延だけで離れたサイト間での密に同期したトレーニングを困難にするため、ローカルな GPU ファブリックの代わりにならない。NVLink ドメインは顧客 VPC として機能できない。オーバーレイはアドレッシングの差異を隠せるが、アンダーレイの故障した光トランシーバーを修復できない。Kubernetes は、プラットフォームがトポロジー情報とデバイス統合を提供しない限り、すべての物理レールを理解せずにポッドをスケジューリングできる。
したがって、アーキテクチャは翻訳された意図の連鎖である。顧客はクラスター、名前空間、ネットワーク、ジョブを要求する。CoreWeave の制御システムはその要求を利用可能なサーバー、ファブリック、ストレージ、ポリシーにマッピングする。Nimbus は VPC の意図を DPU とアンダーレイの状態にマッピングする。Kubernetes と Slurm 関連サービスはワークロードの意図をノードとアクセラレーターにマッピングする。Mission Control はヘルスシグナルを修復アクションにマッピングする。顧客にはサービスが見えるが、プラットフォームはそれらの翻訳の一貫性を保たなければならない。
ラックスケールドメイン内部のスケールアップネットワーキング
スケールアップネットワーキングは、密に統合されたシステム内部のアクセラレーターを接続する。NVIDIA のラックスケール設計では、NVLink が高帯域幅の GPU 間通信を提供し、NVSwitch がそのローカルドメイン全体のスイッチングを提供する。CoreWeave は、選択されたシステムと世代の一部としてこれらの技術を組み込んでいる。
重要な特性はブランド名ではなく、近接性である。スケールアップドメインは、モデルの分割と集合演算が、すべてのステップで通常のデータセンターファブリックを経由せずにデータを交換することを可能にする。これにより、ラックが独立したサーバーの集合体というよりも、一つの大きなアクセラレーターシステムのように振る舞うことができる。また、明確な障害ドメインも生み出す。ラック内のスイッチ、ケーブル、冷却の問題、またはコンポーネントの障害は、スケジューラーが一緒に動作すると期待していた多くの GPU に影響を与えうる。
CoreWeave の目論見書は、最大 3,200 ギガビット毎秒のノンブロッキング GPU 相互接続帯域幅を持つ、選択されたクラスター構成について説明している。「選択されたクラスター構成」という言葉が証拠上の重みの大部分を担っている。これは普遍的なサービスレベルを確立するものではなく、すべてのサイトやアクセラレーター世代を説明するために使うべきではない。ワークロードが利用可能な実効帯域幅は、ソフトウェア、トポロジー、メッセージパターン、経路全体の健全性にも依存する。
スケールアップ設計は一つのボトルネックを狭める一方で、他の場所の密度を高める。より多くのアクセラレーターとより多くのローカル帯域幅は、ラックの電力、冷却、保守性の要件を引き上げる。一致する熱的・運用的設計なしにコンピュートを集中させるシステムは、修理が困難になったり、ボトルネックをスケールアウトリンクやストレージに移動させたりする可能性がある。アーキテクチャは、一連の最大スペックとしてではなく、コンポーネント間のバランスとして読み取られなければならない。
スケールアウトファブリック:InfiniBand と Ethernet の両方が存在する
ジョブがスケールアップ境界を越えると、スケールアウトファブリックに入る。CoreWeave の公開提出書類と技術資料は、NVIDIA Quantum-2 InfiniBand、Quantum-X800 XDR 800 ギガビットファブリック、および RoCE と RDMA を使用する Spectrum-X Ethernet について記述している。InfiniBand と Ethernet の両方が存在することは重要である。同社はプラットフォームのアイデンティティを一つのプロトコルファミリーに限定していない。
密結合クラスター向けの InfiniBand
InfiniBand は低遅延で、リモートダイレクトメモリアクセス指向の通信を中心に構築されており、ハイパフォーマンスコンピューティングで長い歴史を持つ。AI クラスターでは、通常のホスト処理のオーバーヘッドの一部を回避しつつ、アクセラレーターホスト間でデータを移動させることができる。NVIDIA の Quantum システムは、大規模な同期ワークロードに適したスイッチングと集合演算向けの機能を追加する。CoreWeave はこれらのファブリックをクラスター提供に統合しており、InfiniBand を別個のキャリアサービスとして販売しているわけではない。
公開証拠は、すべてのトポロジー、オーバーサブスクリプション比、ルーティングポリシー、サービス境界を開示していない。「ノンブロッキング」という言葉は、フリート全体ではなく特定の設計を説明するかもしれない。よく設計されたファブリックであっても、劣化した光トランシーバー、配置の悪さ、不均一なトラフィック、またはホットスポットを生み出すソフトウェアの挙動によって損なわれうる。したがって、購入者は、自分たちが受け取るクラスターに、どのハードウェア世代、トポロジー、適格性確認が適用されるかを尋ねるべきである。
Spectrum-X と RoCE による Ethernet 経路
Spectrum-X は NVIDIA の Ethernet 指向の AI ネットワーキングプラットフォームである。RoCE は RDMA セマンティクスを Ethernet 上で伝送し、アプリケーションがダイレクトメモリ通信を使用する一方で、運用者が Ethernet ベースのファブリックを維持することを可能にする。CoreWeave の Spectrum-X の使用は、そのエコシステムを中心に設計されたワークロードやシステム世代に対して、プラットフォームに代替のスケールアウト経路を与える。
Ethernet への馴染みは、容易な運用と混同すべきではない。RoCE の性能は、輻輳制御、キュー設計、損失の挙動、テレメトリー、エンドツーエンドの構成に依存する。ネットワークは馴染みの Ethernet フレームを使用しつつも、ヘッドオブライン・ブロッキング、インキャスト、不安定な集合性能を回避するために専門家のエンジニアリングを必要とする可能性がある。統合クラウドの価値は、プロバイダーがそうしたチューニングの多くを引き受けることにある。対応するリスクは、顧客がその選択に対する直接的な可視性をあまり持たないことである。
レール最適化トポロジーと配置
マルチレールシステムは、対応するネットワークインターフェースとアクセラレーターをグループ化し、コレクティブトラフィックが規則的な並列経路を辿るようにする。レール最適化設計は、不要な交差を減らし、帯域幅をより予測可能にできる。また、スケジューラーがトポロジーを理解することも必要とする。誤ったノードの組み合わせにジョブを配置すると、物理設計を台無しにしうる。
レールは故障を集中させうる。一つのレールが劣化すると、他のインターフェースが健全なままであっても、その経路を使用するすべてのノードがストラグラーになる可能性がある。運用システムは、故障したサーバーと共有されたネットワーク障害との違いを検出しなければならない。これが、生のポート速度と同じくらい、トポロジーを考慮したテレメトリー、適格性確認、修復が重要である理由の一つである。
Nimbus がクラウド境界を DPU 上に移動させる
高性能クラスターファブリックは、それ自体でマルチテナントクラウドを生み出すわけではない。顧客はプライベートアドレス、経路制御、インターネットアクセス、他の顧客からの分離を必要とする。CoreWeave の回答は Nimbus である。これは、データプロセッシングユニットに VPC 機能をオフロードする仮想ネットワークアーキテクチャである。公開文書は NVIDIA BlueField-3 DPU を特定し、セキュリティアーキテクチャにおける VRF、VXLAN、EVPN Type 5 ルートについて説明している。
DPU は、顧客が制御するコンピュートとプロバイダーが制御するインフラの間の特権的な位置に座る。仮想ネットワークトラフィックを処理し、セグメンテーションを強制し、ホスト CPU リソースをワークロードのために温存できる。また、顧客が制御するかもしれないオペレーティングシステムの外側に、テナンシーの境界を維持することもできる。その分離は、性能上の決定でもあり、セキュリティ上の決定でもある。
VPC オーバーレイの組み立て方
仮想ルーティング&フォワーディングインスタンスは、一つのルーティングドメインを別のものから分離する。VXLAN は共有された物理アンダーレイ上でテナントセグメントを伝送する。EVPN は到達可能性を配布し、Type 5 ルートは個々の MAC アドレスだけでなく IP プレフィックスを広告できる。これらのメカニズムを組み合わせることで、CoreWeave は共通の物理インフラを使用しながらプライベートネットワークを提供できる。
オーバーレイはアンダーレイへの依存を排除しない。物理的な到達可能性が失敗すれば、仮想ネットワークも共に失敗する。経路の配布が誤っていれば、分離や到達可能性が大規模に破綻しうる。DPU イメージやポリシーシステムにエラーが含まれていれば、多くのホストが同じ不正確な状態を迅速に受け取る可能性がある。クラウドの抽象化は、複雑さをプロバイダーのインフラに移動させることで顧客の複雑さを軽減するのであり、複雑さを取り除くのではない。
DPU が信頼基盤の一部となる
Nimbus は、顧客ホストに対するプロバイダーのネットワーキング機能の露出を減らすが、DPU ファームウェア、セキュアブート、鍵、ポリシー配布、ロギング、リカバリーの重要性を高める。分離を強制するデバイスは、テナント環境への無制御な経路になることなく、観測可能でパッチ可能でなければならない。
この制御境界はインシデント対応にも影響する。接続障害は、顧客のワークロード、Kubernetes ポリシー、VPC 構成、DPU ソフトウェア、EVPN 制御プレーン、物理ファブリックに起因しうる。サポートチームは、あるテナントに別のテナントへの可視性を与えずに、これらのレイヤーを横断する証拠を必要とする。公開文書は意図されたアーキテクチャを説明しているが、分離障害や修復時間に関する独立したフリート全体の記録を公開してはいない。
ベアメタル Kubernetes が顧客の制御面となる
CoreWeave Kubernetes Service は、ベアメタルインフラ上でマネージド Kubernetes を提供する。この設計は、コンテナプラットフォームと GPU サーバーの間に従来の仮想マシン優先のレイヤーを置くことを避けている。各クラスターは独自の VPC を受け取り、このサービスは分散ワークロードのために高性能ネットワークとストレージを統合する。
ベアメタルは一つの抽象化レイヤーを減らすが、システムを単純化するわけではない。Kubernetes は GPU を発見し、デバイスを公開し、クォータを強制し、ポッドを配置し、ネットワークやストレージのプラグインと相互作用する必要がある。プラットフォームは、ノードイメージ、ドライバー、ファームウェア、コンテナランタイム、クラスターのアップグレードを、基盤となるハードウェア世代と調整しなければならない。顧客は馴染みの API を得る一方で、CoreWeave は厳しい互換性マトリクスを引き受ける。
Kubernetes が決定できること、できないこと
Kubernetes は、スケジューラーが利用できる情報とポリシーに従って、ポッドをどこで実行すべきかを決定できる。それは、すべてのレール、光トランシーバー、スイッチ経路、集合性能の状態を自動的に知るわけではない。CoreWeave は、論理的なスケジューリング決定が実行可能な物理的割り当てに対応するように、デバイスプラグイン、オペレーター、トポロジー情報、運用制御を追加しなければならない。
ネットワークポリシーも同様にスコープが限定される。Kubernetes ポリシーはワークロード間の許可トラフィックを制限できるが、VPC と DPU 制御はより広範なテナンシーとルーティング境界を提供する。ポリシーオブジェクトは、パケット経路が意図されたルールを強制していることの証明にはならない。構成、実装、観測が一致しなければならない。
SUNK がクラスターをマネージドスーパーコンピューターに変える
SUNK は、本番環境向けのマネージドスーパーコンピューター提供として位置づけられている。大規模な専用環境を望むが、自ら完全な施設と運用チームを構築したくない顧客向けに、インフラ、高性能ファブリック、ワークロードオーケストレーション、CoreWeave の運用を組み合わせる。
このサービスは責任の分割方法を変える。顧客は依然としてモデルアーキテクチャ、コード、データ、ジョブ戦略を所有するが、ハードウェアのライフサイクル、クラスターの適格性確認、インシデント対応のより多くが CoreWeave に移る。その結果は、交換可能なインスタンスの通常のプールというよりも、クラウド時代の契約とソフトウェアを通じて提供されるマネージド HPC 施設に似ている。
Mission Control が運用を製品の一部にする
Mission Control は監視、保守、修理、ライフサイクルサポートを追加する。その重要性はジョブが大規模なときに最も理解しやすい。小さなサーバープール内の単一の故障コンポーネントを交換することの影響は限定的かもしれないが、密に同期した割り当ての中で劣化したリンクを診断することは、数千のアクセラレーター時間が有用か無駄かを決定づけうる。
CoreWeave のサービス資料は、プロアクティブな監視と運用介入について説明している。これにより意図されたモデルは確立されるが、独立して検証されたアップタイムや公的な平均修復時間分布ではない。インシデントの完全な統計がないことは重要である。なぜなら、信頼性こそが、顧客がクラスターを自ら構築する代わりにプロバイダーに支払う主な理由の一つだからである。
ストレージはネットワーク化された計算の一部である
トレーニングデータ、チェックポイント、モデルアーティファクトは、ワークロード全体を制約しうるストレージ経路を通って移動する。例外的な GPU 間帯域幅を持つクラスターも、入力の読み取り、チェックポイントの書き込み、状態の回復が十分に速くなければ停止しうる。CoreWeave のプラットフォームはオブジェクトストレージとファイルストレージを含み、高性能なデータ移動をサービスの一部として説明している。
チェックポイントトラフィックは独自の運用パターンを生み出す。多数のワーカーが、調整された間隔で状態を永続化する必要があるかもしれない。そのバーストは、集合通信とはタイミングが異なりうる。ストレージトラフィックがトレーニングファブリックと物理リソースを共有する場合、設計には分離またはキャパシティプランニングが必要である。別のネットワークを使用する場合、プラットフォームは依然として両方の経路にわたって障害と復旧を調整しなければならない。
ストレージは移植性にも影響する。モデルを CoreWeave に移動するには、別のクラウドやプライベート環境からの大規模なインバウンド転送が必要になりうる。外部へ移動するには、コスト、時間、契約上の摩擦が生じうる。「Zero Egress Migration」は CoreWeave のプラットフォームへの特定の移行コストを削減する商業的メカニズムであり、技術的な保証、普遍的な無料エグレス、データ移動に運用コストがかからないことの証明と誤解してはならない。
したがって、スタックを評価する顧客は、エンドツーエンドの証拠を求めるべきである。アクセラレーターとファブリックのピーク結果は有用だが、本番のワークロードにはデータセットの準備、チェックポインティング、モデルレジストリの活動、ロギング、復旧が含まれる。一つのレイヤーを分離するベンチマークは、完全なジョブがどれだけ速く完了するかという経済的な問いに答えることはできない。
バックボーンはリージョンをつなぐが、一つの同期スーパーコンピューターではない
CoreWeave は、地上および海底ファイバーを介して北米と欧州のデータセンターを結び、直接ピアリングおよびプライベート接続サービスを備えたキャリアグレードのバックボーンについて説明している。同社の提出書類は、場所と可用性に応じて、10、100、400 Gbps の Direct Connect オプションを挙げている。
バックボーンは、ローカルなスケールアウトファブリックとは異なる目的を果たす。データセット、レプリカ、チェックポイント、制御トラフィック、推論トラフィックをリージョン間で移動させることができる。ユーザーや他のクラウドを接続できる。復旧と分散をサポートできる。長距離の伝播遅延は、遠隔の施設を密結合ジョブ向けの一つの低遅延トレーニングファブリックにはしないことを意味する。
プライベート接続が不確実性の一種を低減する
専用回線は、パブリックインターネットのルーティング変動の一部を回避し、より明確なキャパシティとサポート境界を提供できる。しかし、完全にプライベートなエンドツーエンドの世界を創り出すわけではない。顧客のアクセスは、キャリア、クロスコネクト、データセンター事業者に依存しうる。クラウドオンランプには独自の受入と構成がある。経路の多様性と物理的所有権は、すべての場所について完全には開示されていない。
したがって、CoreWeave を Tier-1 キャリアと説明すべきではない。同社はバックボーンを運用しピアリングしているが、提供された証拠は、全世界へのセトルメントフリーな到達可能性や、すべてのファイバー経路の所有権を確立するものではない。同社の強みは、自社のコンピュート資産への統合されたアクセスであり、グローバルなキャリアエコシステムの代替ではない。
リージョン設計が可用性の選択を生み出す
CoreWeave は 2025 年末時点で 6 カ国に施設を報告した。施設の数は、すべてのアクセラレーター世代、ファブリック、サービス、プライベート接続速度が各国で利用可能であることを意味しない。リージョンは段階的に開設される。なぜなら、電力、冷却、ネットワーク、ハードウェア、運用の準備が一瞬で揃うわけではないからである。
顧客にとって、地理は遅延以上の影響を持つ。データガバナンス、クラウドの隣接性、人員配置、電源、障害の相関、ローカル経路を誰が制御するかに影響する。CoreWeave にとって、新しい国が加わるたびに、容量とともに、法務、電力会社、サプライチェーンの調整が追加される。したがって、ネットワークの地理的拡大は、同一の箱の地図ではなく、運用モデルである。
信頼性は資本を有用な時間へ変換することである
CoreWeave のハードウェアは、ジョブが進行していようと待機していようと、融資を受けている。したがって、信頼性は財務上の変数である。ファブリックの故障、劣化した GPU、ストレージの停止、スケジューラーのエラーは、利息、リース、電力義務が続く中で、課金可能で有用な成果を減少させうる。
ストラグラーは完全な故障よりも重要である
故障したノードは可視的である。ストラグラーは、すべての同期ポイントを減速させながら、技術的には稼働し続けるかもしれない。したがって、大規模なジョブは、単なるバイナリのヘルスではなく、劣化した性能を検出できるテレメトリーを必要とする。スケジューラーと運用チームは、そのコンポーネントをドレインするか、交換するか、あるいは使い続けるかを決定する必要がある。
公開記録は、ジョブの障害、テールレイテンシー、ストラグラーの発生に関する完全な分布を提供していない。この不在は信頼性の低さを証明するものではないが、独立した比較を制限する。顧客は、アーキテクチャ図から外挿するのではなく、契約、ワークロードテスト、自身の運用証拠に依存しなければならない。
適格性確認はシステムテストである
クラスターを公開する前に、CoreWeave はサーバー、スイッチ、光トランシーバー、ケーブル、ファームウェア、ドライバー、ストレージ、オーケストレーションを一緒に適格性確認しなければならない。起動テストに合格するだけでは不十分である。有用なテストは、完全なトポロジーが意図されたワークロードを持続させ、障害を生き延び、新たな不一致を生み出すことなく修復できるかどうかである。
適格性確認には時間の次元もある。あるソフトウェアとファームウェアのセットで機能した設計は、アップグレード後に異なる挙動を示すかもしれない。新しい NVIDIA 世代の急速な導入は、CoreWeave がサポートしなければならない組み合わせの数を増加させる一方で、古い契約環境は依然としてサービス中である。運用の成熟度とは、すべてのサイトを独自の例外に変えることなく、その重複を管理する能力である。
ファイナンスはアーキテクチャの一層である
CoreWeave は 2025 年に 51 億ドルの収益と 12 億ドルの純損失を報告した。同年度中に固定資産および機器に対して 103 億ドルを現金で支出した。年末時点の残存履行義務は 607 億ドルであった。同じ提出書類は、大規模な機器ファイナンス、負債、リース、インフラのコミットメントについても記述していた。
これらの数値は異なるものを記述している。収益は認識されたサービス収入である。固定資産および機器に対して支払われた現金は投資の流出であり、導入されたフリート全体の評価ではない。純損失は、成長がまだ連結収益性を生み出していないことを示す。残存履行義務は、会計ルール上の契約済み将来履行分を表し、銀行の現金でも、すでに提供されたサービスでもない。
2026 年第 1 四半期は需要と維持コストを同時に示した
2026 年 3 月 31 日に終了した四半期について、CoreWeave は 20 億 7800 万ドルの収益、7 億 4000 万ドルの純損失、5 億 3600 万ドルの支払利息を報告した。また、同社の定義に基づき 994 億ドルのバックログを報告した。これらの結果は、同期間に強い需要の可視性と重い資金調達負担があることを示している。
バックログは、年末の残存履行義務と直接交換可能ではない。定義とタイミングが異なる。両方とも将来の契約需要を示すが、その変換は、CoreWeave が施設、電力、ハードウェア、ネットワーク容量を稼働させ、その後契約を満足させるかどうかに依存する。バックログが説得力を持つほど、それに付随する提供義務も大きくなる。
GPU 担保付きファイナンスが資産と契約を整合させる
CoreWeave は、担保付きローン、機器ファイナンス、顧客担保型の仕組みを利用して拡大資金を調達してきた。2026 年 6 月には、当該取引について GPU 担保付きかつ投資適格と格付けされた、85 億ドルのファイナンス枠を発表した。この枠により展開能力が拡大するが、これは収益ではなく、すべての企業債務に対する投資適格格付けを確立するものではない。
資産担保ファイナンスは、負債をハードウェアおよび契約キャッシュフローと一致させることができる。また、担保、展開、現金使用に関する制限を生み出す可能性もある。アクセラレーター、スイッチ、光トランシーバーは、多くの伝統的なインフラ資産に比べて早期に陳腐化する。このファイナンスモデルは、利用率が高く維持され、顧客契約が機器が最も経済的に価値のある期間を超えて続く場合に最も機能する。
したがって、ネットワーク設計は信用の質に影響する。より高い利用率を実現するトポロジーは、融資を受けた資産の生産的成果を改善する。遅延したサイト、持続的なストラグラー問題、失敗した移行はそれを低下させうる。CoreWeave のモデルでは、システム工学とバランスシート工学は別の物語ではない。
顧客の集中もインフラ依存である
Microsoft が CoreWeave の 2025 年収益の 67% を占めた。大口のアンカーテナントは、キャパシティを正当化し、資金調達を支援し、プロバイダーに早期の機器調達に対する自信を与える。同じ集中は、顧客に交渉力を与え、利用率を一つの商業関係に敏感にする。
CoreWeave は、Meta や Anthropic を含む追加顧客との関係を発表または報告しており、Flow Traders は 2026 年 7 月に同社を基盤モデルのトレーニングに選定し、Leidos は防衛、国家安全保障、インテリジェンス分野の AI に関する協業を発表した。これらの声明は、情報源が記述するレベルでの契約、選定、または協業を確立するものである。集中が消滅したことや、発表されたすべてのキャパシティがすでに展開されていることを証明するものではない。
テイクオアペイ契約はリスクを排除せずに移転する
複数年のテイクオアペイ契約は、CoreWeave に需要の可視性を与え、資金調達を支援しうる。コミットされた支払いは短期的な消費だけに基づくわけではないため、利用率リスクの一部をプロバイダーから顧客に移転する。建設、電力、納入、性能、信用、再交渉のリスクを排除するものではない。
顧客にとって、この契約はクラウドの約束の一部を逆転させる。伝統的なパブリッククラウドは弾力的な消費と限定的なコミットメントを強調する。専用の AI クラスターは、プロバイダーが特定のキャパシティを建設または予約しているため、より長期的でインフラに近い関係を必要としうる。サービスはインターフェースではクラウドソフトウェアのように見えながら、その下ではプロジェクトファイナンスのように振る舞いうる。
防衛および規制対象の業務が保証の閾値を引き上げる
2026 年 7 月 30 日の Leidos との協業は、プラットフォームを防衛およびインテリジェンスのミッションへと拡張する。そうした協業は、規制対象業務に必要なあらゆる認可、認証、展開を確立するものではない。これは、セキュリティ、サプライチェーンの管理、監査可能性、運用の継続性が、CoreWeave の製品のより重要な部分になりうることを示している。
DPU によって強制される VPC、プライベート接続、マネージドオペレーションは、高保証設計を支援しうる。しかし、プログラム固有の統制、人員要件、データの取り扱い、政府の承認を代替するものではない。同社がミッションセンシティブなワークロードに近づくほど、その責任境界はより透明でなければならなくなる。
買収がスタックを上方に動かし、失敗した合併は下方を指した
2025 年、CoreWeave は Weights & Biases、OpenPipe、marimo、Monolith AI を買収した。Weights & Biases はモデル開発と可観測性のツールを追加し、他の買収は推論、ノートブック、産業用 AI の能力を拡大した。これらの取引により、CoreWeave は生のインフラの上方、開発ライフサイクルのより多くの部分へと移動する。
戦略的論理は明確である。モデルのワークフローを理解するプロバイダーは、需要予測を改善し、インフラを消費しやすくし、開発のより多くの段階にわたって顧客を維持できる。統合のリスクも同様に明確である。ソフトウェア事業は、ファイナンスで支えられたデータセンター運営とは異なるリリースサイクル、マージン、文化を持つ。CoreWeave が、これまで顧客が独立系ベンダーから入手していたツールを自ら所有しようとすると、製品の重複やパートナーとの衝突が生じうる。
提案された Core Scientific の買収は逆の方向を指していた。CoreWeave は 2025 年 7 月に合併契約を発表し、これによりデータセンター容量とリース経済に対する支配が強化されるはずだった。Core Scientific は株主投票の後、2025 年 10 月 30 日に契約を終了した。CoreWeave は同社を買収しなかった。
これらを合わせると、二つの方向の統合戦略が明らかになる。すなわち、上方へ開発者ソフトウェアへ、下方へ物理的キャパシティへ向かう。失敗した合併はまた、インフラに対する支配が、プラットフォームが望むスケジュールで常に購入できるとは限らないことを示している。株主、規制当局、資金調達、契約構造が、垂直統合の技術的論理を阻みうる。
CoreWeave が制御するもの、その境界の外に残るもの
CoreWeave は顧客プラットフォーム、多くの設計選択、機器の適格性確認、オーケストレーション、運用プロセスを制御する。Nimbus が VPC をどのようにマッピングするか、クラスターがどのように提示されるか、どのサービスが管理されるか、インシデントがどのように処理されるかを選択できる。ハードウェアを早期に調達し、アクセラレーター密度を中心に施設を編成することもできる。
NVIDIA は GPU、NVLink、InfiniBand、Spectrum-X、BlueField の重要な製品ロードマップを制御する。公益事業者とデータセンターパートナーは、電力と施設提供の一部を制御する。ファイバーキャリア、エクスチェンジ、クラウドプロバイダーは外部接続の一部を制御する。レンダーと機器ファイナンス業者は資本使用を制約する。大口顧客は契約を通じてキャパシティ計画に影響を与える。
これは CoreWeave に固有の欠陥ではない。すべてのクラウドはサプライヤーと施設に依存する。この集中が重要なのは、CoreWeave の差別化が NVIDIA システムの迅速な展開と密接に結びついており、資本のコミットメントがその運用履歴に比べて異常に大きいからである。一つのサプライヤーでの遅延やロードマップの変更は、顧客への提供と資金調達に波及しうる。
このプラットフォームの強みは、それらの境界を越えた調整にある。そのリスクは相関する依存性にある。すなわち、同じサプライヤー世代、サイト設計、顧客プログラムが一度に多くのレイヤーに影響を与えうる。統合は顧客が管理しなければならない契約の数を減らすが、プロバイダーレベルの障害の影響を増大させうる。
競合ポジション:専門クラウドは責任に関する選択である
CoreWeave は、ハイパースケールクラウド、他の専門 GPU クラウド、顧客所有のクラスター、コロケーション・ホスティング・マネージド統合の組み合わせと競合する。比較は、GPU の数や一つのベンチマークに還元できない。購入者は、利用可能なハードウェア世代、ファブリック、ストレージ、スケジューリング、プライベート接続、サポート、契約期間、地理、データ移動の総コストを比較する。
ハイパースケールクラウドに対して
AWS、Microsoft Azure、Google Cloud、Oracle は、幅広いサービスポートフォリオ、グローバルなエコシステム、大規模なバランスシートを提供する。顧客がすでに利用しているデータベース、セキュリティ、分析、エンタープライズ調達と AI インフラを組み合わせることができる。CoreWeave の対抗ポジションは専門性である。選択された NVIDIA 世代のより速い統合、ベアメタルオーケストレーション、高密度アクセラレーターワークロードを中心に設計されたプラットフォームである。
専門性は抽象化を減らし、適格性確認を短縮しうる。また、より狭い障害とサプライヤーのプロファイルを生み出しうる。CoreWeave を選ぶ顧客は、ワークロードに焦点を当てたプロバイダーを得る一方で、サービス幅の狭さと若い資本構成を受け入れることになる。正しい比較はカテゴリー別ではなく、ワークロード固有である。
他の専門クラウドに対して
Lambda、Nebius、Crusoe、その他の AI インフラプロバイダーは、アクセラレーター供給、クラスター、マネージドサービスで重複する。それらの違いは、地理、エネルギー戦略、ソフトウェアポートフォリオ、所有権、資本構造、施設の支配度合いにある。「ネオクラウド」は市場のラベルであり、共通のアーキテクチャではない。
CoreWeave の公開企業としての提出書類は、規模とリスクについて異例のほど詳細な証拠を提供する。それらは、それ自体で優れた技術や経済性を確立するものではない。開示の少ない競合他社は、より小規模であるか、より効率的であるか、あるいは単により不透明であるかもしれない。分析は透明性を性能ランキングに変えるべきではない。
プライベートクラスターの構築に対して
顧客所有のクラスターは、購入者にハードウェア、データ、運用に対する直接的な制御を与える。また、調達、電力、施設、ネットワーキング、ストレージ、セキュリティ、ファームウェア、スペアパーツ、専門スタッフも必要とする。CoreWeave はその負担の多くを移転することを販売している。
その移転は不完全である。顧客は依然としてワークロードを設計し、データを管理し、ポリシーを設定し、プロバイダーリスクを評価する。長期契約は移行の柔軟性を低下させうる。プライベートクラスターは顧客側での過少利用のリスクを伴い、クラウド契約はプロバイダーへの依存のリスクを伴う。経済的な選択は、どちらの当事者が変動を吸収し、高価なシステムを生産的に保つ能力に優れているかである。
液冷スイッチングが次のボトルネックが移動しうる場所を示す
2026 年 7 月、CoreWeave はラックあたりのネットワーク帯域幅密度を高めるために設計された液冷スイッチングを記述した資料を公開した。この主張は、独立したフリート全体のベンチマークではなく、同社のアーキテクチャと計算に結びつけられている。しかしながら、このメカニズムは重要である。アクセラレーター密度が高まるにつれ、スイッチと光トランシーバーは十分な電力を消費し、十分な熱を発生するため、ラックレベルの冷却問題の一部となる。
スイッチを液体で冷却することで、制約のあるラックエンベロープ内により多くのネットワーク容量を確保でき、スイッチングをより遠くに配置する必要性を減少させうる。より短い経路はケーブル接続を簡素化し、密度を維持しうる。この設計はまた、ネットワークメンテナンスを液冷システムに結合させる。漏れ、ポンプの問題、サービス手順は、これまで空冷ネットワーク機器として管理されていたコンポーネントに影響を与えうる。
この変化はより広範なパターンを示している。AI インフラのボトルネックは移動する。より高速な GPU はより多くのスケールアップ帯域幅への需要を生み出す。より多くのラック帯域幅はより高密度なスケールアウトスイッチングへの需要を生み出す。より高密度なスイッチングは電力と冷却の要件を引き上げる。新しい施設は異なる機械的・電気的設計を必要とする。したがって、製品世代はサーバーのアップグレードではなく、データセンターの再設計となりうる。
Vera Rubin は将来の移行であり、導入済みフリートの記述ではない
CoreWeave の 2026 年 7 月の資料は、NVIDIA Vera Rubin NVL72 システムの準備について説明し、Blackwell と比較したトークンあたりメガワットに関する同社の測定または将来予想に基づく主張を行っている。これらの主張は CoreWeave と指定された構成に帰属すべきである。これらは調査カットオフ時点でのフリート全体の可用性を確立するものではない。
新しい世代は一度に複数のレイヤーを変える。すなわち、アクセラレーター、スケールアップファブリック、スケールアウト帯域幅、ラック電力、冷却、ファームウェア、ドライバー、オーケストレーション、適格性確認である。これはメガワットあたりの出力を改善しつつ、既存の施設を不適切または競争力を低下させうる。CoreWeave が新しいハードウェアを迅速に採用する能力は、古い契約資産全体の移行、利用率、減価償却を管理できる場合にのみ戦略的な強みとなる。
この移行はまた、NVIDIA への依存を深める。早期アクセスは顧客を惹きつけ、プレミアム契約を支援しうる。それは同社を、制御できないサプライヤーのタイミング、価格設定、アーキテクチャ決定にさらしうる。顧客層やソフトウェア層での多様化は、必ずしも物理スタックを多様化するわけではない。
スタックのより広範なデジタルインフラへの影響
CoreWeave の拡大は、GPU レンタルをはるかに超える市場に影響を与える。ギガワットのコミットメントは、発電、系統連系、変圧器、冷却、土地、建設に対する需要を生み出す。高ラディックスファブリックは、スイッチ、光トランシーバー、ファイバーへの需要を生み出す。プライベート接続は、キャリアのキャパシティ、エクスチェンジのプレゼンス、クラウドオンランプへの需要を生み出す。ファイナンス構造は、迅速に陳腐化する技術を長期契約に対して評価できるレンダーへの需要を生み出す。
また、このプラットフォームはインターネットトラフィックの出現場所を変える。密に結合したトレーニングトラフィックはほとんどローカルファブリック内に留まるが、データセット、チェックポイント、モデルアーティファクト、推論リクエスト、開発者ワークフローは、クラウド、データセンター、ユーザー間を移動する。したがって、目に見えるインターネットへの影響は、一つの巨大なトレーニングフローからよりも、トレーニング環境周辺の持続的な動きからもたらされる可能性がある。
施設をホストするコミュニティや系統にとって、スタックは電力と土地利用の決定である。この調査パックは、企業全体の環境結論を出すのに十分なサイトレベルの証拠を提供していない。しかし、稼働電力と契約電力が同社の成長の重要な尺度であり、電力や施設の提供の遅延が事業リスクであることを確立している。
ネットワークエンジニアにとって、このアーキテクチャは AI インフラがそれ自体の分野になりつつあることを示している。ルーティングとスイッチングの知識は依然として必要だが、今やそれは集合通信ライブラリ、アクセラレータートポロジー、液冷、ワークロードスケジューリング、プロジェクトファイナンスと出会う。輻輳をチューニングする者は、ジョブの完了と債務返済の両方を保護しているかもしれない。
公開証拠が示せないこと
CoreWeave は製品ドキュメント、技術ブログ、財務提出書類を公開しているが、スタックは依然として部分的に不透明である。提供された資料には、完全な現行トポロジー、サイト毎のファブリック一覧、オーバーサブスクリプション表、ファイバー所有権マップ、インシデント履歴、ワークロード毎の独立したベンチマークアーカイブは公開されていない。
この境界は主張の枠組みを変えるべきである。アーキテクチャの文書化はメカニズムを確立できる。SEC 提出書類は連結された財務とリスクの事実を確立できる。顧客名入りの発表は選定または協業を確立できる。これらの情報源のいずれも、普遍的なワークロードの結果、フリート全体のアップタイム、またはすべての購入者にとってのより低い総コストを証明するものではない。
スケールについても同じ注意が当てはまる。稼働電力は契約電力ではない。バックログは収益ではない。予定された将来の決算説明会は結果ではない。発表された顧客契約は実際の利用率と同じではない。提案された買収は所有権ではない。将来のハードウェア世代は現在のフリートではない。
これらの区別はプロフィールを弱めない。それらは専門の読者が管理しなければならない実際の情報ギャップを特定する。CoreWeave は、最も価値のある詳細が必然的に非公開である統合システムを、顧客と資本提供者に信頼するよう求めている。合理的な対応は、卓越性か失敗かのどちらかを仮定することではない。検討中の契約、クラスター、サイトのレベルで証拠を要求することである。
中心的な判断
CoreWeave の製品はしばしばコンピュート容量と表現される。より深い製品は調整である。同社はサプライヤーのロードマップとデータセンター建設を、スケールアップリンクとスケールアウトファブリックを、DPU ポリシーとテナントの意図を、Kubernetes スケジューリングと物理トポロジーを、ストレージとチェックポイントの挙動を、バックボーン接続と顧客アクセスを、長期ファイナンスと短いハードウェア世代を調整しなければならない。
その調整は真の優位性を生み出しうる。専門プロバイダーは、顧客に別々のベンダーを組み立てるよう求める代わりに、ワークロード全体にわたって選択を行うことができる。システムを適格性確認し、故障を修復し、多くの企業が単独で可能なよりも速く新世代を導入できる。プラットフォームの急速な成長は、主要顧客がその責任の移転を評価していることを示唆している。
この同じ統合は帰結を集中させる。ファブリック設計、サプライヤーの遅延、ポリシーエラー、資金調達の制約、アンカーカスタマーの変更が、システムの大部分に影響を与えうる。同社の未来は一つの表向きの帯域幅の数字には依存しない。それは、すべてのレイヤーが融資を受けたキャパシティを信頼できる顧客の仕事へと変換し続けられるかどうかにかかっている。
会員向け解説
プロフィールの詳細
適切な会員レベルでログインすると、解説全文と出典メモをご覧いただけます。
Strategic Circle 限定
Strategic Circle
すべての読者に公開されています。参加してログインすると プロフィール解説 を閲覧できます。
Strategic Circle に参加Leadership Alliance 会員限定
Leadership Alliance
対象となる IP 資産の所有者・管理者向けです。ログインすると Leadership Alliance の解説を閲覧できます。
Leadership Alliance に参加
