要約
- CoreWeave のネットワークスタックは、スケールアップ、スケールアウト、ストレージ、テナント、管理、バックボーン、プライベート接続にわたる。これは運用アーキテクチャであって、独立した製品ではない。
- NVIDIA のファブリックと DPU を CoreWeave のソフトウェアと統合し、専用クラウド内でアクセラレータのスケジューリング、テナント分離、データ移動を行う。
- CoreWeave は43のデータセンター、850MW 超の稼働電力、約3.1GW の契約済み電力を発表。2025年の収益の67%を Microsoft が占め、規模と集中度の高さを示す。
- 課題は、契約済み電力と受注残を、資金調達コスト、リース費用、ハードウェアの陳腐化、運用の複雑さが積み上がる前に、信頼性が高く多様なサービスに転換することである。
物理的なプレゼンスは、ありきたりなクラウドリージョンマップが示すよりも急速に拡大した
2025年12月31日時点で、CoreWeave は43カ所のデータセンターを運用し、稼働電力は850MW 超、契約済み電力は約3.1GW と報告した。稼働電力の数値は、同日時点の同社の定義に基づく運用インフラを表す。契約済みの数値は、将来の展開に向けた権利と義務を示すものであり、設置済み容量として扱うべきではない。
その拡大ペースは急激だった。2023年末で10カ所・約70MW、2024年末で32カ所・360MW 超、2025年末で43カ所・850MW 超。2026年第1四半期には、CoreWeave は1GW 超の稼働電力と3.5GW 超の契約済み電力を発表した。これらの数字は、施設と運用を産業スピードで拡張しようとする企業の姿を示すと同時に、旧来のアーキテクチャがいかに急速に、全フリートの中でも少数派へと転じるかを浮き彫りにする。
電力はあくまで前提条件であり、完成した製品ではない。契約済みの MW は依然として、系統連系もしくは発電設備、高密度な電力分配、冷却、建屋の準備、ネットワーク経路、アクセラレータの納入、運用上の受け入れを必要とする。いずれか一つの層における遅延が、収益の発生を遅らせる可能性がある。その一方で、一部の義務はそれ以前に発生し始める。
データセンターのモデルはハイブリッドである。CoreWeave は設備を所有し、大規模な展開をコントロールするが、リース施設や外部プロバイダーも利用する。これにより地理的な拡張を加速し、すべてを自前で建設することを回避できる。しかし同時に、施設所有者のパフォーマンスや建設スケジュール、電力供給、契約条件が、プラットフォームの信頼性の一部となる。
GPU 1基だけではまだクラウドではない
ラックに設置され電力が供給されたアクセラレータは、コードを実行できる。しかしそれだけでは、顧客がクラウドに求めているものを提供できない。トレーニングを実行するチームは、多数のアクセラレータが単一の割り当てとして動作することを必要とする。データは必要な速度でストレージから到着しなければならず、Allreduce などの集団操作は、大部分の時間を通信待ちに費やすことなく、GPU 間で行われる必要がある。テナントは分離されたままであり、スケジューラは、どのノード、リンク、デバイスが正常かを認識していなければならない。チェックポイントは障害に耐えなければならない。エンジニアは環境へのパスを必要とし、ユーザーは他のクラウド、オフィス、サービスへの外向きのパスを必要とする。クラウド製品は、これらのパスが再現可能になったときに初めて存在し始める。
これが、AI 専用クラウドにおいてネットワークを、単なるコンピューティングの付属物として扱うことができない理由である。従来のエンタープライズ設計では、ネットワークはしばしばサーバを接続するシステムとして説明される。しかし分散 AI においては、ネットワークは実際のコンピューティングに直接参加する。劣化した光モジュール1つ、スロークラーのアクセラレータ、輻輳した並列パス、または負荷に追いつかないストレージパスが、密結合されたジョブの進行を遅らせることがある。ジョブが待機している間、アイドル状態のハードウェアのコストは積み上がり続ける。したがって、ネットワーク設計はベンチマークのパフォーマンスと、資金調達されたすべての GPU 時間の経済性の両方に影響を及ぼす。
CoreWeave の特異性は、汎用クラウド内部の単なる GPU サービスとしてではなく、アクセラレータ専用のインフラストラクチャを構築している点にある。そのため、同社の公開資料は、ラックファブリック、DPU、ベアメタルオーケストレーション、マネージドスーパーコンピュータ、プライベート接続、オペレーショナルな修復について、シンプルなインスタンスカタログよりもかなり詳細に記述している。これらの記述は、設計意図と製品設計の証拠であるが、全拠点、全世代、または全顧客展開の完全なマップではない。
問題は、CoreWeave が抽象的に「高速なネットワーク」を持っているかどうかではない。意味のある問いは、AI ワークロードが信頼できるサービスとして機能する前に、いくつの異なるネットワークが協調しなければならないか、そして誰がそれぞれを制御しているか、である。
「CoreWeave のネットワークアーキテクチャ」という名称が実際に意味するもの
このフレーズは編集上の包括用語であり、法的エンティティでも、独立した販売単位でもない。法的・経済的な運営主体は、デラウェア州で設立され、ニュージャージー州リビングストンに本社を置き、Nasdaq でティッカーCRWV として上場している CoreWeave, Inc.である。ネットワークアーキテクチャは、より広範な CoreWeave Cloud Platform の内部に存在する。このプラットフォームには、コンピューティング、ストレージ、オーケストレーション、マネージドサービスも含まれる。
複数の名称が異なる層を指している。Nimbus は、CoreWeave の DPU ベースの仮想ネットワークアーキテクチャである。CoreWeave Kubernetes Service(CKS)は、ベアメタル上でのマネージド Kubernetes を提供する。SUNK は、インフラストラクチャと運用をマネージドスーパーコンピュータサービスにまとめたものである。Mission Control は、監視、修復、ライフサイクルサポートを追加する。Direct Connect は、顧客にプライベート接続を提供する。NVLink、NVSwitch、Quantum、Spectrum-X、BlueField といった NVIDIA の名称は、CoreWeave が統合するサプライヤー技術を指しており、同社の発明ではない。
これらの層を区別することで、2つのよくある誤りを防げる。第1に、プラットフォーム内のすべてのプロトコルやデバイスを CoreWeave に帰属させる誤り。同社の貢献は、サプライヤー技術を取り巻くシステムインテグレーション、認定、運用、クラウドソフトウェアにある。第2に、すべての GPU からすべての顧客に至る単一のファブリックを想像する誤り。ノード内のスケールアップリンク、ノード間のトレーニングファブリック、ストレージネットワーク、VPC オーバーレイ、管理経路、大西洋横断バックボーンは、目的、遅延許容度、障害ドメインが異なる。これらを単一の帯域幅数値に還元すべきではない。
同様の規律は所有権にも当てはまる。CoreWeave は大規模な設備を展開し運用しているが、同社の開示はリース、第三者データセンター、電力コミットメント、ファイバー関係、機器ファイナンスについても記述している。サービスは運用上統合されていても、同社が建物、電力設備、長距離経路、ラック内の全コンポーネントを所有しているとは限らない。「垂直統合」という言葉は、完全な自給自足ではなく、多数の層にわたる制御の調整を意味する場合にのみ有益である。
Atlantic Crypto から専用コンピューティングへ
CoreWeave は2017年に The Atlantic Crypto Corporation として創業した。初期のビジネスは暗号通貨のワークロードに GPU 資産を活用するものであり、2018年9月に LLC からデラウェア州の法人へと移行した。専用クラウドコンピューティングへのピボットに伴い、2019年12月に CoreWeave の名称を採用した。
この起源は、暗号マイニングと AI の間の皮肉な対比に矮小化されることがある。しかし、より重要な連続性は運用面にある。両方の活動には、アクセラレータを購入し、電力を確保し、高密度ハードウェアを稼働させ続け、余剰キャパシティにワークロードを振り向ける主体が必要である。初期の会社は、マルチテナントシステム、ネットワーク、ストレージ、そしてクラウドが必要とするサポートを構築する前に、アクセラレータフリートの経済性を学んだ。
この区別は重要である。需要の変化が自動的にプラットフォームを生み出すわけではないからだ。マイニングのワークロードは比較的反復的であり、シンプルな資産モデルに対して寛容でありえた。ビジュアルエフェクト、機械学習、高性能コンピューティングは、異なるソフトウェア、データ移動、分離、サービス保証を必要とする。CoreWeave は、外部の顧客が、自分たちが所有せず物理的に検査もできないリソースを信頼できるようにするための層を追加しなければならなかった。
2020年代初頭を通じて、同社は専用コンピューティング、ストレージ、Kubernetes サービスを開発した。ベアメタル Kubernetes は主要なインターフェースとなり、顧客はまず従来の仮想マシン層を経由することなく、コンテナ化されたワークロードを直接アクセラレータサーバ上にスケジューリングできるようになった。2023年末までに、CoreWeave は10カ所のデータセンターと約70MW の稼働電力を報告した。2024年末までに、その数は32カ所、360MW 超に増加した。
この拡大は、ネットワーク問題の性質を変えた。10拠点の事業者は、専門家の知識とローカルな例外に大きく依存できる。しかし30~40拠点のクラウドには、反復可能な設計、ソフトウェアで管理されたポリシー、標準化された認定、共通の監視、そして運用上の一貫性を失うことなくハードウェア世代を越えて顧客を移行させる方法が必要になる。規模は、優れたエンジニアリング上の選択をガバナンス上の問いに変える。誰が変更を承認するのか、例外はどれだけ早く検出されるのか、新しい各拠点は意図された制御境界を再現しているのか、といった問いである。
CoreWeave は2025年3月に新規株式公開(IPO)を完了した。上場は株主資本を追加しただけでなく、目論見書と SEC 開示を通じて、拠点、顧客集中度、負債、リース、相互接続設計、リスクに関する情報を提供した。これにより、ネットワークアーキテクチャを技術システムとして、かつ公開企業のコミットメントとして研究することが可能になった。
ワークロードがアーキテクチャを決定する
大規模モデルのトレーニングは、アクセラレータ間で計算を分割し、部分的な結果を頻繁に交換する。正確な通信パターンはモデルアーキテクチャ、並列化方式、ソフトウェアによって異なるが、インフラストラクチャ上の課題は一貫している。割り当ての有効速度は、局所的な計算と同様に、集団通信に依存する。総体的には高速に見えるファブリックであっても、輻輳、トポロジ、またはエッジレイテンシがジョブを保持する同期ポイントを遅延させる場合、容量を浪費する可能性がある。
アーキテクチャはまた、集団通信のように振る舞わないトラフィックにも対応しなければならない。データセットは環境内に流入する。チェックポイントは GPU メモリからストレージに移動する。コントロールプレーンはジョブとポリシーを配布する。エンジニアはログを取得する。サービスは推論ポイントを公開し、バックアップとレプリカがリージョンを越えることがある。各カテゴリは、遅延と損失に関して異なる許容度を持つ。これらすべてを単一の区別されないネットワークとして扱うならば、パフォーマンスの予測と障害の分離はより困難になる。
その結果、多層設計が生まれる。ノード内のスケールアップリンクは、ラックレベルのシステム内に密結合ドメインを作成する。スケールアウトファブリックは、多数のシステムをラック間にわたって相互接続する。ストレージパスはワークロードにデータを供給し、状態を保存する。テナントネットワークは、顧客にプライベートアドレスとポリシーを提供する。管理ネットワークは、事業者にホスト、DPU、スイッチ、修復経路への制御権を与える。バックボーンは拠点と外部システムを接続し、顧客専用回線はクラウドを他の管理ドメインに結びつける。
これらの層は相互作用するが、相互に交換可能ではない。長距離ファイバーは、伝播遅延だけを取っても、遠隔地間での高度に同期したトレーニングを困難にするため、ローカルな GPU ファブリックの代わりにはならない。NVLink ドメインは顧客の VPC として機能できない。オーバーレイはアドレスの違いを隠蔽できるが、アンダーレイの破損した光モジュールを修復することはできない。Kubernetes は、プラットフォームがトポロジ情報とハードウェア統合を提供しない限り、すべての物理的な並列パスを理解せずにコンテナをスケジューリングできる。
これが、アーキテクチャが意図の一連の変換である理由である。顧客はクラスタ、名前空間、ネットワーク、またはジョブを要求する。CoreWeave のシステムは、その要求を利用可能なサーバ、ファブリック、ストレージ、ポリシーに変換する。Nimbus は VPC の意図を DPU とアンダーレイの状態に変換する。Kubernetes と関連する Slurm サービスは、ワークロードの意図をノードとアクセラレータに変換する。Mission Control はヘルスシグナルを修復アクションに変換する。顧客にはサービスが見える。その間、プラットフォームは変換の一貫性を維持しなければならない。
ラック内のスケールアップ相互接続
スケールアップは、高度に統合されたシステム内でアクセラレータを相互接続する。NVIDIA のラックレベルの設計では、NVLink が GPU 間に高帯域幅の接続を提供し、NVSwitch がそのローカルドメイン内でのスイッチングを処理する。CoreWeave は、選択されたシステムと世代においてこれらの技術を統合している。
重要な特性はブランド名ではなく、近接性である。スケールアップドメインは、モデルの断片と集団操作が、すべてのステップで通常のデータセンターファブリックを横断することなくデータを交換することを可能にする。これにより、ラックが独立したサーバの集合としてではなく、単一の大規模なアクセラレータシステムとして振る舞うことができる。しかしそれはまた、明確な障害ドメインを作り出す。すなわち、ラック内のスイッチ、ケーブル、冷却、またはコンポーネントの故障が、スケジューラが協調動作を期待する多数の GPU に影響を及ぼす可能性がある。
CoreWeave の目論見書は、選択されたクラスタ構成について、最大3,200Gbps のノンブロッキング GPU 相互接続帯域幅を説明している。「選択された構成」という言葉が、立証上の重みのほとんどを担っている。これは普遍的なサービスレベルを証明するものではなく、すべての拠点やアクセラレータ世代を記述するために使用すべきではない。ワークロードが利用できる実際の帯域幅は、ソフトウェア、トポロジ、メッセージングパターン、エンドツーエンドのパスの健全性にも依存する。
スケールアップ設計は一つのボトルネックを軽減するが、他の場所では密度を高める。より多くのアクセラレータとより高いローカル帯域幅は、ラックの電力、冷却、保守性の要件を引き上げる。密度の高いシステムを、同等の熱的・運用上の設計なしに修理することはより困難になるか、あるいはボトルネックをスケールアウトリンクやストレージの方へ移してしまう可能性がある。したがって、アーキテクチャは一連の最大スペックとしてではなく、コンポーネント間のバランスとして読まれるべきである。
スケールアウトファブリック:InfiniBand と Ethernet が共存する
ワークロードがスケールアップの範囲を超えると、スケールアウトファブリックに入る。CoreWeave の開示および技術情報は、NVIDIA Quantum-2 InfiniBand、800G の Quantum-X800 XDR ファブリック、RoCE と RDMA を使用する Spectrum-X Ethernet について説明している。InfiniBand と Ethernet の両方が存在することは注目に値する。なぜなら、同社がプラットフォームのアイデンティティを単一のプロトコルファミリーに還元していないからである。
密結合クラスタ向け InfiniBand
InfiniBand は、低遅延で RDMA 指向の通信を中心に構築されており、高性能コンピューティングにおいて長い歴史を持つ。AI クラスタ内では、通常のホスト処理の一部をバイパスしながら、アクセラレータホスト間でデータを移動させることができる。NVIDIA の Quantum システムは、大規模な同期ワークロードに適したスイッチング機能と集団操作向けの機能を追加する。CoreWeave はこれらのファブリックをクラスタ製品に統合するものであり、InfiniBand を独立したトランスポートサービスとして販売しているわけではない。
公開されている証拠は、すべてのトポロジ、オーバーサブスクリプション比率、ルーティングポリシー、またはサービス制限を明らかにしているわけではない。「ノンブロッキング」という言葉は、全フリートではなく特定の設計を表現している可能性がある。良好なファブリックでさえ、劣化した光モジュール、不適切なノード配置、不均衡なトラフィック、または輻輳ホットスポットを作り出すソフトウェアの挙動によって損なわれうる。そのため、購入者は、ハードウェアの世代、トポロジ、適用される認定について、受け取る予定の特定のクラスタに関して質問すべきである。
Ethernet 経路としての Spectrum-X と RoCE
Spectrum-X は、Ethernet ベースの AI ネットワーキングを指向した NVIDIA のプラットフォームである。RoCE は Ethernet 上で RDMA セマンティクスを伝送し、事業者が Ethernet ベースのファブリックを維持したまま、アプリケーションが直接メモリアクセス通信を行うことを可能にする。CoreWeave による Spectrum-X の利用は、このエコシステム向けに設計されたワークロードとシステム世代に対して、プラットフォームに代替のスケールアウト経路を提供する。
Ethernet の遍在性は、運用上の単純さと混同されるべきではない。RoCE のパフォーマンスは、輻輳制御、キュー設計、損失挙動、テレメトリ、およびエンドツーエンドのチューニングに依存する。ネットワークは馴染み深い Ethernet フレームを使用するかもしれないが、ヘッドオブラインブロッキング、インキャスト、または集団パフォーマンスの不安定性を回避するために、専門的な設計を必要とする可能性がある。統合クラウドの価値は、プロバイダーがこのチューニングの多くを負担することであり、それに対応するリスクは、顧客がその選択に対する直接的な可視性を失うことである。
トポロジとレール最適化配置
マルチレールシステムは、集団トラフィックが規則的な並列パスをたどるように、対称的なネットワークインターフェースとアクセラレータをグループ化する。レール最適化設計は、不要なホップを減らし、帯域幅の予測可能性を高めることができる。しかし、スケジューラがトポロジを理解することも必要となる。ジョブを誤ったノードセットに分散させると、物理設計の利点が無効になる可能性がある。
レールはまた、障害を集中させることもある。単一のパスが劣化すると、他のインターフェースが健全であっても、それを使用するすべてのノードが低速に見える。運用システムは、故障したサーバと、共有されたネットワークの弱さを区別しなければならない。これが、トポロジを認識した測定、認定、修復が、ポートの生の速度と同じくらい重要である理由である。
Nimbus はクラウド境界を DPU へ移す
高性能なクラスタファブリックは、それ自体ではマルチテナントクラウドを生み出さない。顧客は、プライベートアドレス、経路制御、インターネットアクセス、そして他の顧客からの分離を必要とする。CoreWeave の回答は、VPC 機能を DPU へ移行させる仮想ネットワークアーキテクチャである Nimbus である。公開文書は、NVIDIA BlueField-3 DPU を特定し、セキュリティアーキテクチャにおける VRF、VXLAN、EVPN Type 5ルートについて記述している。
DPU は、顧客が制御するコンピューティングとプロバイダーが制御するインフラストラクチャとの間の、特権的な位置を占める。DPU は、仮想ネットワーキングトラフィックを処理し、セグメンテーションを実施し、ホスト CPU リソースをワークロードのために節約することができる。また、顧客が制御する可能性のあるオペレーティングシステムの外部にテナント境界を保つこともできる。この分離は、パフォーマンス上の決定であると同時に、セキュリティ上の決定でもある。
VPC オーバーレイの構築方法
VRF(仮想ルーティング&フォワーディング)は、あるルーティングドメインを別のドメインから分離する。VXLAN は、共有された物理アンダーレイを横断してテナントセグメントを伝送する。EVPN は到達可能性情報を配布し、Type 5ルートは個々の MAC アドレスだけでなく IP プレフィックスを広告できる。これらのメカニズムが連携することで、CoreWeave は共有された物理インフラストラクチャの上にプライベートネットワークを提供できる。
オーバーレイはアンダーレイへの依存を取り除くわけではない。物理的な到達可能性が失われれば、仮想ネットワークも同様に機能しなくなる。ルート配布に誤りがあれば、分離または到達範囲が大規模に損なわれる可能性がある。DPU イメージやポリシーフレームワークにバグが含まれていれば、多数のホストが同じ誤った状態を急速に受け取る可能性がある。クラウドオーバーレイは、複雑さをプロバイダーのインフラストラクチャに移すことで、顧客側の複雑さを軽減する。しかし、それを取り除くわけではない。
DPU が信頼の基盤の一部になる
Nimbus は、プロバイダーのネットワーク機能が顧客ホストに露出するのを減らすが、DPU ファームウェア、セキュアブート、キー、ポリシー配布、ログ、およびリカバリの重要性を高めることになる。分離を実施するデバイスは、テナント環境への制御されない経路となることなく、監視可能かつ更新可能でなければならない。
この境界はまた、インシデント対応にも影響を与える。接続障害は、顧客のワークロード、Kubernetes ポリシー、VPC 設定、DPU ファームウェア、EVPN コントロールプレーン、または物理ファブリックから発生しうる。サポートチームは、あるテナントを別のテナントに晒すことなく、これらの層を横断する証拠を必要とする。公開文書は意図されたアーキテクチャを記述しているが、フリート全体にわたる分離障害や修復時間の独立した記録を公開しているわけではない。
顧客のコントロールプレーンとしてのベアメタル Kubernetes
CoreWeave Kubernetes Service(CKS)は、ベアメタルインフラストラクチャ上でマネージド Kubernetes を提供する。この設計は、コンテナプラットフォームと GPU サーバの間に、仮想マシンを起点とする従来の層を置くことを避ける。各クラスタは独自の VPC を取得し、サービスは分散ワークロードのために高性能ネットワークとストレージを統合する。
ベアメタルは抽象化の層を一つ取り除くが、システムを単純にするわけではない。Kubernetes は、GPU を発見し、デバイスを公開し、クォータを実施し、コンテナを配置し、ネットワークやストレージのアドオンと相互作用しなければならない。プラットフォームは、ノードイメージ、ドライバ、ファームウェア、コンテナランタイム、クラスタのアップグレードを、基礎となるハードウェア世代と整合させなければならない。顧客は馴染み深いインターフェースを得るが、CoreWeave は困難な互換性マトリックスを引き継ぐ。
Kubernetes が決定できることとできないこと
Kubernetes は、スケジューラが利用可能な情報とポリシーに基づいてコンテナを配置できる。しかし、すべてのレール、光モジュール、スイッチパス、または集団パフォーマンスの状態を自動的に認識するわけではない。CoreWeave は、論理的な決定が有効な物理的割り当てに対応するように、デバイスプラグイン、オペレータ、トポロジ情報、および運用ガードレールを追加しなければならない。
ネットワークポリシーの範囲も同様に制限されている。Kubernetes ポリシーは、ワークロード間で許可されるトラフィックを制限できるが、VPC と DPU の制御は、より広範なテナント境界とルーティング境界を提供する。ポリシーオブジェクトの存在は、パケット経路が意図されたルールを実施していることを証明するものではない。設定、施行、可観測性が整合していなければならない。
SUNK はクラスタをマネージドスーパーコンピュータに変える
SUNK は、本番環境向けのマネージドスーパーコンピュータサービスとして提供される。これは、インフラストラクチャ、高性能ファブリック、ワークロードオーケストレーション、CoreWeave の運用を、大規模な専用環境を求めるが、施設や完全な運用チームを自前で構築したくない顧客向けにパッケージ化したものである。
このサービスは、責任の分担を変える。顧客は引き続き、モデルアーキテクチャ、コード、データ、ジョブ戦略に対して責任を負うが、ハードウェアライフサイクル、クラスタ認定、インシデント対応のより大きな部分が CoreWeave に移行する。その結果は、交換可能なインスタンスの一般的なプールというよりは、クラウド時代の契約とソフトウェアで提供されるマネージド HPC 施設に近い。
Mission Control は運用を製品の一部にする
Mission Control は、監視、保守、修復、ライフサイクルサポートを追加する。その重要性が最も明確になるのは、ジョブが大規模である場合である。小さなサーバプールにおける故障コンポーネントの交換は、限定的な影響しか与えないかもしれないが、密結合された割り当ての中で劣化したリンクを診断することは、数千時間のアクセラレータ時間が有効か無駄になるかを決定づける可能性がある。
CoreWeave のサービス資料は、プロアクティブな監視と運用上の介入を記述している。これは意図されたモデルの証拠ではあるが、独立して検証された稼働時間や、平均修復時間(MTTR)のパブリックな分布を証明するものではない。完全なインシデント履歴が存在しないことは、顧客がクラスタを自前で構築する代わりにプロバイダーに支払う主な理由の一つが信頼性であるため、重要である。
ストレージは密結合計算の一部である
トレーニングデータ、チェックポイント、モデルファイルは、ワークロード全体を律速しうるストレージパスを移動する。GPU 間のネットワーク帯域幅が優れていても、入力の読み取り、チェックポイントの書き込み、状態の復元を十分な速度で行えなければ、クラスタは停止する可能性がある。CoreWeave のプラットフォームはオブジェクトストレージとファイルストレージを含み、高性能データ移動をサービスの一部として説明している。
チェックポイントトラフィックは、特異な運用パターンを生み出す。多数のワーカーが、協調された間隔で状態を保存する必要があり、集団通信とは異なるタイミングのバーストを生成する。ストレージトラフィックがトレーニングファブリックと物理リソースを共有する場合、設計には分離または慎重な容量計画が必要である。独立したネットワークを使用する場合でも、プラットフォームは両方の経路にわたって障害とリカバリを調整しなければならない。
ストレージは可搬性にも影響する。モデルを CoreWeave に持ち込むには、別のクラウドやプライベート環境からの大規模なインバウンド転送が必要になる場合がある。モデルを取り出すには、コスト、時間、契約上の摩擦が生じる可能性がある。CoreWeave の「Zero Egress Migration」は、同社のプラットフォームへの移行に関する一部のコストを引き下げる商業的な仕組みであり、技術的な保証、永続的な無償の出口保証、あるいはデータ移動の運用コストがゼロであることの証明ではない。
したがって、スタックを評価する顧客は、エンドツーエンドの証拠を求めるべきである。アクセラレータとファブリックのピーク結果は情報価値があるが、本番環境のワークロードには、データ準備、チェックポイント管理、モデルレジストリ、ログ、リカバリが含まれる。単一層を隔離するテストは、完全なジョブが完了するまでにどれだけの時間がかかるかという経済的な問いには答えない。
バックボーンはリージョンを接続するが、単一の同期スーパーコンピュータではない
CoreWeave は、北米と欧州のデータセンターを結ぶ、陸上および海底ファイバーを用いたキャリアグレードのバックボーン、直接ピアリング、プライベート相互接続サービスについて説明している。同社の開示は、拠点と利用可能性に応じて、10Gbps、100Gbps、400Gbps の速度の Direct Connect オプションを列挙している。
バックボーンは、ローカルのスケールアウトファブリックとは異なる目的を果たす。バックボーンは、データセット、レプリカ、チェックポイント、コントロールプレーンのトラフィック、リージョン間の推論を移動させ、ユーザーを他のクラウドに接続し、リカバリと分散をサポートすることができる。しかし、長距離の伝播遅延は、離れた拠点を密結合ワークロード用の単一の低遅延トレーニングファブリックに変えることを妨げる。
プライベート接続は、ある種の不確実性を低減する
専用回線は、公共インターネット経路の変動の一部を回避し、より明確な容量境界とサポートを提供できる。しかし、完全にプライベートなエンドツーエンドの世界を創り出すわけではない。顧客のアクセスは、キャリア、クロスコネクト、データセンター事業者に依存する可能性がある。クラウドオンボード地点には独自のアドミッションとプロビジョニングがある。全拠点の経路多様性と物理的所有権が完全に開示されているわけではない。
このため、CoreWeave は Tier 1キャリアと表現すべきではない。同社はバックボーンを運用し、トラフィックを交換しているが、提示された証拠は、決済なしの普遍的な到達可能性、またはすべてのファイバー経路の所有権を証明していない。同社の利点は、コンピューティング施設への統合的なアクセスであり、グローバルな通信システムの代替ではない。
リージョン設計は可用性の選択肢を生み出す
CoreWeave は、2025年末時点で6カ国に拠点があると報告した。この集計は、すべてのアクセラレータ世代、ファブリック、サービス、またはプライベート接続速度が、すべての国で利用可能であることを意味しない。電力、冷却、ネットワーキング、ハードウェア、運用の準備が同時に整うわけではないため、リージョンは段階的に開設される。
顧客にとって、地理的条件は遅延以上のものに影響を与える。データガバナンス、他のクラウドへの近接性、人材、電源、障害相関、ローカル経路を誰が制御するかにも影響する。CoreWeave にとっては、各国が、容量に加えて、法的、公益事業的、サプライチェーン的な調整を追加する。したがって、ネットワークの地理的拡大は、同一の箱を並べた地図ではなく、運用モデルである。
信頼性は資本を有益な時間に変えることである
CoreWeave のハードウェアは、ジョブが進行しているか待機しているかに関わらず、資金調達されている。したがって、信頼性は財務上の変数である。ファブリックの停止、劣化した GPU、ストレージのストール、スケジューラのエラーは、利息、リース、電力コミットメントが継続する中で、有益で請求可能なアウトプットを減少させる可能性がある。
低速なコンポーネントは完全な故障よりも危険である
ダウンしたノードは可視的である。低速なコンポーネントは、技術的には生きている状態のまま、すべての同期ポイントを遅延させる可能性がある。そのため、大規模なジョブには、単なるバイナリのヘルスチェックではなく、パフォーマンスの劣化を検出する測定が必要である。スケジューラと運用チームは、コンポーネントドレイン、交換、または継続使用を決定しなければならない。
公開記録は、ジョブの失敗、テールレイテンシ、または低速コンポーネントの有病率の完全な分布を提供していない。この欠如は、信頼性の低さを証明するものではないが、独立した比較を制限する。顧客は、アーキテクチャ図から推測するのではなく、契約、負荷テスト、および自身の運用実績に依拠しなければならない。
認定は完全なシステムテストである
CoreWeave は、クラスタを利用可能にする前に、サーバ、スイッチ、光モジュール、ケーブル、ファームウェア、ドライバ、ストレージ、およびオーケストレーションを一緒に認定しなければならない。起動テストだけでは十分ではない。意味のあるテストは、完全なトポロジが意図された負荷を維持し、障害に耐え、新たな不整合を生み出すことなく修復可能かどうかである。
認定には時間的な次元もある。あるソフトウェアおよびファームウェアスタックで成功した設計が、アップグレード後には異なる挙動を示す可能性がある。新しい NVIDIA 世代を迅速に導入することで、CoreWeave がサポートしなければならない組み合わせの数は増加し、一方で、契約された旧環境は依然として稼働し続ける。運用上の成熟度とは、各拠点を独自の例外に変えることなく、この重なりを管理することである。
資金調達はアーキテクチャの一層である
CoreWeave は、2025年の収益51億ドル、純損失12億ドルを報告した。同年中に、有形固定資産の取得に103億ドルの現金を支出した。年度末の残存履行義務(RPO)は607億ドルだった。同じ開示は、大規模な機器ファイナンス、負債、リース、およびインフラストラクチャコミットメントを説明していた。
これらの数字は異なるものを表している。収益は認識されたサービス収入である。有形固定資産への現金支出は、投資キャッシュアウトフローであり、設置済みフリート全体の評価額ではない。純損失は、成長がまだ連結ベースでの収益性を達成していないことを示す。RPO は、会計ルールに基づく将来の契約済みパフォーマンスを表しており、銀行にある現金でも、すでに提供されたサービスでもない。
2026年第1四半期は需要とキャリーコストの両方を示した
2026年3月31日を末日とする四半期について、CoreWeave は収益20.78億ドル、純損失7.4億ドル、支払利息5.36億ドルを報告した。同社はまた、自社の定義によるバックログが994億ドルであると報告した。この結果は、強い需要のシグナルと重い資金調達負担が、同じ期間に並存していることを示している。
バックログは、定義とタイミングが異なるため、年末の RPO と直接交換することはできない。両方とも将来の契約済み需要を示唆するが、転換は、CoreWeave が施設、電力、ハードウェア、ネットワーク容量をサービスに導入した後、契約を履行することにかかっている。バックログが強く見えるほど、それに紐付く履行コミットメントも大きくなる。
GPU 担保ファイナンスは資産と契約を結びつける
CoreWeave は、担保付きローン、機器ファイナンス、および顧客支援ストラクチャーを使用して拡大資金を調達してきた。2026年6月、同社は、GPU を裏付けとし、特定のトランザクションについては投資適格と評価された85億ドルのファシリティを発表した。このファシリティは展開能力を拡大するが、収益ではなく、また、すべての企業債務にわたる投資適格格付けを証明するものでもない。
アセットバックドファイナンスは、負債をハードウェアおよび契約上のキャッシュフローと整合させることができる。また、担保、展開、キャッシュの使用に関する制約を課すこともある。アクセラレータ、スイッチ、光モジュールは、多くの従来型インフラ資産と比較して急速に陳腐化する。このモデルが最も成功するのは、稼働率が高く、顧客契約が、ハードウェアが経済的に最も価値のある期間を超えて継続する場合である。
したがって、ネットワーク設計は信用力に影響を与える。より高い稼働率を達成するトポロジは、資金調達された資産からの生産的アウトプットを増加させる。拠点の遅延、持続するストラグラー問題、または失敗した移行は、それを減少させる可能性がある。CoreWeave のモデルにおいて、システム工学とバランスシート工学は別個の物語ではない。
顧客集中はインフラストラクチャにおけるもう一つの依存関係である
2025年の CoreWeave の収益の67%を Microsoft が占めた。大規模なアンカー顧客は、容量を正当化し、資金調達を支援し、事業者に早期の機器購入の確信を与えることができる。しかし、その同じ集中は、顧客に交渉力を与え、稼働率を単一の商業関係に敏感にする。
CoreWeave は、Meta、Anthropic を含む追加顧客との関係を発表または報告している。2026年7月には、Flow Traders が基礎モデルのトレーニングに同社を選択し、Leidos は防衛、国家安全保障、インテリジェンス向け AI に関する協業を発表した。これらの声明は、情報源が記述する水準での契約、選択、または協業の証拠である。しかし、集中が解消されたこと、または発表されたすべての容量がすでにサービスに入っていることを証明するものではない。
テイク・オア・ペイ契約はリスクを移転するが、除去しない
複数年にわたるテイク・オア・ペイ契約は、CoreWeave に需要の可視性を与え、資金調達を支援することができる。コミットされた支払いが短期的な消費のみに依存しないため、稼働率リスクの一部をプロバイダーから顧客へ移転する。しかし、建設、電力、納入、パフォーマンス、信用、再交渉のリスクを除去するものではない。
顧客にとって、契約はクラウドの約束の一部を反転させる。従来のパブリッククラウドは、弾力的な消費と限定的なコミットメントを強調する。専用 AI クラスタには、プロバイダーが特定の容量を建設または予約したため、より長期的でインフラストラクチャに近い関係が必要になる場合がある。サービスはインターフェースではクラウドソフトウェアのように見えても、その下ではプロジェクトファイナンスのように振る舞う。
防衛および規制対象ビジネスは保証のハードルを引き上げる
2026年7月30日に発表された Leidos との協業は、プラットフォームを防衛およびインテリジェンスのミッションに拡大する。この協業は、規制対象業務に必要なすべての認可、認定、または展開を証明するものではない。しかし、セキュリティ、サプライチェーンの保証、監査可能性、および運用継続性が、CoreWeave 製品のより重要な部分になる可能性があることを示唆している。
DPU で実施される VPC、プライベート接続、マネージド運用は、高保証設計をサポートできる。しかし、それらはプログラム上の制御、人材要件、データ処理、政府の承認の代わりにはならない。同社がミッションクリティカルなワークロードに近づくほど、その責任境界はより明確でなければならない。
買収はスタックを上流へ動かし、一方失敗した取引は下流を示す
2025年、CoreWeave は Weights & Biases、OpenPipe、marimo、Monolith AI を買収した。Weights & Biases はモデル開発および監視ツールを追加し、その他の買収は推論、ノートブック、産業用 AI の能力を拡大した。これらの取引は、CoreWeave を純粋なインフラストラクチャの上流、開発サイクルのより多くの部分へと移動させる。
戦略的論理は明確である。モデルワークフローを理解するプロバイダーは、需要予測を改善し、インフラストラクチャの消費を容易にし、開発のより多くの段階を通じて顧客を維持することができる。統合リスクも同様に明確である。ソフトウェア企業は、資金調達されたデータセンターの運用とは異なる、リリースサイクル、マージン、文化を持っている。製品の重複やパートナーとの対立は、CoreWeave が、顧客が独立系サプライヤーから取得していたツールを所有しようとする場合に現れる可能性がある。
提案された Core Scientific の買収は、反対方向を示した。CoreWeave は、データセンター容量とリースの経済性に対する支配を強めるはずだった合併契約を2025年7月に発表した。Core Scientific は、株主投票の後、2025年10月30日に契約を終了させた。CoreWeave は同社を買収しなかった。
これらの取引は全体として、双方向の統合戦略、すなわち、開発者ソフトウェアに向かう上流と、物理的容量に向かう下流を明らかにする。失敗した取引はまた、インフラストラクチャの支配が、プラットフォームが望むスケジュールで常に購入できるとは限らないことを示している。株主、規制当局、資金調達、取引構造は、垂直統合の技術的論理を妨げる可能性がある。
CoreWeave が制御するものと、境界の外に残るもの
CoreWeave は、顧客プラットフォーム、多くの設計上の選択、機器の認定、オーケストレーション、およびライブ運用を制御する。同社は、Nimbus が VPC を変換する方法、クラスタの提示方法、マネージドサービス、およびインシデントの処理方法を選択できる。同社は、ハードウェアを早期に購入し、アクセラレータ密度を中心に施設を編成することができる。
NVIDIA は、GPU、NVLink、InfiniBand、Spectrum-X、BlueField の重要な製品ロードマップを制御する。電力会社とデータセンターパートナーは、電力供給と施設の一部を制御する。ファイバー事業者、エクスチェンジ、クラウドプロバイダーは、外部接続の一部を制御する。レンダーと機器ファイナンス提供者は、資本の使用を制約する。大口顧客は、契約を通じて容量計画に影響を与える。
これは CoreWeave に固有のものではない。すべてのクラウドがサプライヤーと施設に依存している。しかし、CoreWeave の差別化要因は、NVIDIA システムの迅速な展開に強く結びついており、その資本コミットメントは、その運用歴に比して大きいため、集中は本質的な問題である。サプライヤーのロードマップの遅延や変更は、顧客への納入や資金調達に連鎖する可能性がある。
プラットフォームの強みは、これらの境界をまたぐ調整にある。そのリスクは、相関する依存関係にある。すなわち、同じサプライヤー世代、同じ拠点設計、または同じ顧客プログラムが、複数の層に同時に影響を与える可能性がある。統合は、顧客が管理しなければならない契約の数を減らすが、プロバイダーレベルの失敗の影響を増幅する可能性がある。
競争上の位置:専用クラウドは責任の選択である
CoreWeave は、ハイパースケーラー、他の専用 GPU クラウド、顧客所有のクラスタ、コロケーション、ホスティング、マネージドインテグレーションの組み合わせと競合する。比較を GPU の数や単一のベンチマークに還元することはできない。購入者は、利用可能なハードウェア世代、ファブリック、ストレージ、スケジューリング、プライベート接続、サポート、契約期間、地理的条件、および完全なデータ移動のコストを比較する。
ハイパースケーラーとの比較
AWS、Microsoft Azure、Google Cloud、Oracle は、幅広いサービスポートフォリオ、グローバルシステム、大規模なバランスシートを提供する。これらは、AI インフラストラクチャを、顧客がすでに使用しているデータベース、セキュリティ、分析、エンタープライズ調達と組み合わせることができる。CoreWeave の対抗する立場は専用性である。すなわち、選択された NVIDIA 世代のより迅速な統合、ベアメタルオーケストレーション、高密度のアクセラレータワークロード向けに構築されたプラットフォームである。
専用性は抽象化を減らし、認定を短縮する可能性があるが、より狭い障害ドメインとサプライヤードメインを生み出すこともある。CoreWeave を選択する顧客は、より少ないサービスの幅と、より新しい資本構造を受け入れる代わりに、ワークロードにフォーカスしたプロバイダーを得る可能性がある。正しい比較はワークロード固有であり、一般的なカテゴリーではない。
他の専用クラウドとの比較
Lambda、Nebius、Crusoe、およびその他の AI インフラストラクチャプロバイダーは、アクセラレータ、クラスタ、マネージドサービスの提供において一部重複している。これらは、地理的条件、エネルギー戦略、ソフトウェアポートフォリオ、所有権、資本構造、および施設への制御の程度が異なる。「ネオクラウド」は市場のラベルであり、共有されたアーキテクチャではない。
CoreWeave の公開開示は、規模とリスクに関する異例の詳細な証拠を提供する。しかし、それだけでは技術的または経済的な優位性を立証できない。より小規模で、より効率的で、または単により不透明な競合他社も存在しうる。透明性はパフォーマンスランキングに変換されるべきではない。
自前のクラスタ構築との比較
顧客所有のクラスタは、ハードウェア、データ、運用に対する直接的な制御を提供する。しかし、調達、電力、施設、ネットワーク、ストレージ、セキュリティ、ファームウェア、スペアパーツ、専任スタッフが必要となる。CoreWeave は、その負担の多くを移転することを販売している。
その移転は完全ではない。顧客は依然としてワークロードを設計し、データを管理し、ポリシーを設定し、プロバイダーのリスクを評価しなければならない。長期のコミットメントは、移行の柔軟性を低下させる可能性がある。自前のクラスタは内部的な過少稼働リスクを負い、クラウド契約はプロバイダー依存のリスクを負う。経済的な選択は、どちらの当事者コストがかかり、あまりにもコストがかかるようになったシステムの生産性をよりうまく吸収し、維持できるかである。
液冷スイッチは次のボトルネックがどこに移動するかを明らかにする
2026年7月、CoreWeave は、ラックあたりの帯域幅密度を向上させることを目的とした液冷スイッチを説明する資料を公開した。この主張は、フリート全体にわたる独立したテストではなく、同社のアーキテクチャと計算に結びついている。それでも、そのメカニズムは重要である。アクセラレータの密度が上昇するにつれて、スイッチと光モジュールは、ラックの冷却問題の一部となるのに十分な電力を消費し、熱を発生させる。
スイッチの液冷は、ラックのフットプリント内により多くのネットワーク容量を許容し、スイッチングを遠くに配置する必要性を減らす可能性がある。より短い経路はケーブリングを簡素化し、密度を維持する。しかし、この設計はネットワークの保守を液冷システムに結びつける。漏れ、ポンプの故障、または保守手順は、以前は空冷のネットワーク機器として管理されていたコンポーネントに影響を与える可能性がある。
この変更は、より広範なパターンを示している。すなわち、AI インフラストラクチャのボトルネックは移動する。より高速な GPU は、より高いスケールアップ帯域幅を必要とする。より高いラック帯域幅は、より高密度なスケールアウトスイッチングを必要とする。高密度なスイッチングは、電力と冷却の要件を引き上げる。そして、新しい施設は異なる機械的・電気的設計を必要とする。これが、製品世代が単なるサーバのアップグレードではなく、データセンターの再設計になりうる理由である。
Vera Rubin は将来の移行であり、現行フリートの記述ではない
CoreWeave の2026年7月の資料は、NVIDIA Vera Rubin NVL72 システムへの準備について記述し、Blackwell と比較して、ワットあたりのトークン数に関する自社測定または予測的な主張を提示している。これらの主張は、言及された構成における CoreWeave に帰属させるべきである。これらは、調査日時点でのフリート全体での可用性を証明するものではない。
新世代は、アクセラレータ、スケールアップファブリック、スケールアウト帯域幅、ラック電力、冷却、ファームウェア、ドライバ、オーケストレーション、認定という、多くの層を同時に変化させる。これは、メガワットあたりのアウトプットを改善する一方で、既存の施設を不適切にしたり、競争力を低下させたりする可能性がある。CoreWeave が新しいハードウェアを迅速に採用する能力は、契約された旧資産の移行、稼働率、減価償却を管理する場合にのみ、戦略的な強みとなる。
この移行は、NVIDIA への依存を深める。早期のアクセスは顧客を引き付け、高価格の契約をサポートする可能性があるが、同社を、自らがコントロールできないサプライヤーのタイミング、価格設定、アーキテクチャ上の決定に晒す。顧客やソフトウェアの多様化は、必ずしも物理スタックを多様化するわけではない。
デジタルインフラストラクチャにおけるスタックのより広範な影響
CoreWeave の拡大は、GPU レンタルをはるかに超える市場に影響を与える。ギガワット級のコミットメントは、発電、系統連系、変圧器、冷却、土地、建設に対する需要を生み出す。高ポートカウントのファブリックは、スイッチ、光モジュール、ファイバーに対する需要を生み出す。プライベート接続は、通信容量、エクスチェンジプレゼンス、クラウドオンボードに対する需要を生み出す。資金調達ストラクチャーは、長期契約に対して急速に陳腐化するテクノロジーを評価できるレンダーに対する需要を生み出す。
このプラットフォームはまた、インターネットトラフィックの可視性の場所を変える。密結合されたトレーニングトラフィックは、主にローカルファブリック内に留まるが、データセット、チェックポイント、モデルファイル、推論要求、開発者パスは、クラウド、データセンター、ユーザー間を移動する。インターネット上の可視的な影響は、単一の大規模なトレーニングフローからよりも、トレーニング環境を取り巻く定常的なトラフィックから生じる可能性がある。
施設をホストするコミュニティや電力網にとって、スタックはエネルギーと土地利用の決定を表している。本調査ファイルは、企業全体に対する環境判断を下すのに十分な拠点レベルの証拠を提供しない。しかし、稼働電力と契約済み電力が成長の基本的な指標であり、電力や施設の遅延は事業リスクであることを立証している。
ネットワークエンジニアにとって、このアーキテクチャは、AI インフラストラクチャが独自の専門分野になったことを示している。ルーティングとスイッチングの知識は依然として不可欠だが、今やそれは、集団通信ライブラリ、アクセラレータトポロジ、液冷、ジョブスケジューリング、プロジェクトファイナンスと交差する。輻輳を調整する人物は、ジョブの完了と債務返済の両方を守っているかもしれない。
公開証拠が示せないこと
CoreWeave は、製品ドキュメント、技術ブログ、財務開示を公開しているが、スタックは部分的に不透明なままである。提示された資料は、完全な現在のトポロジ、拠点別のファブリックのインベントリ、オーバーサブスクリプションスケジュール、ファイバー所有権マップ、完全なインシデント履歴、またはワークロード全体にわたる独立したテストアーカイブを提供していない。
この限界は、主張の組み立て方を変えるべきである。アーキテクチャ文書は、メカニズムを立証できる。SEC 開示は、連結財務上の事実とリスクを立証できる。指名された顧客の声明は、選択または協業を立証できる。これらはいずれも、ワークロード全体にわたる一般的な結果、フリート全体の稼働時間、またはすべての購入者にとっての総所有コストの低さを証明するものではない。
同じ注意が規模にも当てはまる。稼働電力は契約済み電力ではない。バックログは収益ではない。将来の決算発表の日付は結果ではない。顧客契約の発表は、アクティブな使用と等しくない。提案された買収は所有権ではない。将来のハードウェア世代は、現在のフリートではない。
これらの区別は、本調査ファイルを弱めるものではなく、プロフェッショナルな読者が管理すべき情報ギャップの実際の場所を特定するものである。CoreWeave は、顧客と資本提供者に対して、統合されたシステムを信頼するよう求めており、その最も重要な詳細は必然的に非公開のままである。合理的な対応は、成功または失敗を仮定することではなく、関連する契約、クラスタ、拠点のレベルでの証拠を求めることである。
中心的判断
CoreWeave の製品は、しばしば計算能力と表現される。より深い製品は、調整である。同社は、サプライヤーのロードマップとデータセンター建設を、スケールアップリンクとスケールアウトファブリックを、DPU ポリシーとテナントの意図を、Kubernetes スケジューリングと物理トポロジを、ストレージとチェックポイントの挙動を、バックボーン接続と顧客アクセスを、長期の資金調達と短期のハードウェア世代を調整しなければならない。
この調整は、本物の優位性を生み出すことができる。専用プロバイダーは、顧客が別々のサプライヤーを統合するよう求めるのではなく、ワークロード全体にわたる決定を下すことができる。システムを認定し、障害を修復し、多くの企業が単独で可能なよりも迅速に新世代を導入することができる。プラットフォームの急速な成長は、大規模な顧客がこの責任の移転を評価していることを示唆している。
しかし、その同じ統合が結果を集中させる。単一のファブリック設計、サプライヤーの遅延、ポリシーのエラー、資金調達の制約、またはアンカー顧客の変更は、システムの大部分に影響を及ぼす可能性がある。同社の将来は、目立った帯域幅の数値ではなく、すべての層が資金調達された容量を信頼できる顧客の仕事に継続的に変換できるかどうかにかかっている。
会員向け解説
プロフィールの詳細
適切な会員レベルでログインすると、解説全文と出典メモをご覧いただけます。
Strategic Circle 限定
Strategic Circle
すべての読者に公開されています。参加してログインすると プロフィール解説 を閲覧できます。
Strategic Circle に参加Leadership Alliance 会員限定
Leadership Alliance
対象となる IP 資産の所有者・管理者向けです。ログインすると Leadership Alliance の解説を閲覧できます。
Leadership Alliance に参加
