要約

  • CoreWeave のネットワークスタックは、スケールアップ、スケールアウト、ストレージ、テナント、管理、バックボーン、プライベート接続の各層に及ぶ。独立した製品ではなく、運用アーキテクチャである。
  • NVIDIA のネットワークと DPU は CoreWeave のソフトウェアと連携し、アクセラレータのスケジューリング、テナントの分離、専用クラウド内でのデータ転送に使われる。
  • CoreWeave は 43 のデータセンター、850MW 超の稼働電力、約 3.1GW の契約電力を報告する。マイクロソフトは 2025 年収益の 67% を占めており、規模と集中度の両方が示される。
  • 重要な試金石は、資金調達コスト、リース、ハードウェアの陳腐化、運用の複雑さが積み上がる前に、契約電力と受注を、信頼でき顧客基盤の多様なサービスへ転換できるかどうかだ。

物理的な規模拡大は、通常のクラウドリージョンマップで表現できる範囲を超えている

2025年12月31日時点で、CoreWeave は 43 のデータセンター、850MW 超の稼働電力、約 3.1GW の契約電力を開示している。稼働の数字は、当時、同社の定義に基づき稼働を開始していたインフラを表す。契約の数字は将来の展開権とコミットメントを表すものであり、設置済み容量と解釈してはならない。

成長は非常に急峻だ。2023年末は 10 のデータセンターと約 70MW、2024年末は 32 拠点と 360MW 超、2025年末は 43 拠点と 850MW 超だった。2026年第1四半期には、同社は 1GW 超の稼働と 3.5GW 超の契約を開示している。これは産業化された拡大ペースを示すと同時に、古いアーキテクチャがどれほど早く少数派になるかを示している。

電力は前提条件であって、完成品ではない。契約済みの MW は依然として、系統接続、発電または電力供給、高密度配電、冷却、建物、ネットワーク経路、アクセラレータの納入、運用検収を必要とする。どの層の遅延も収益を先送りにし得るが、一部のコストと義務はすでに発生し始めている。

データセンターの形態はハイブリッドだ。CoreWeave は設備を所有し、多くの展開を自社で制御する一方、リース施設と第三者サービス事業者も利用する。これにより地理的拡大は速まるが、同時に、不動産所有者の対応、建設スケジュール、電力供給、契約条件がプラットフォームの信頼性の一部になる。

GPU が1枚あるだけではクラウドにはならない

通電したラックに置かれたアクセラレータはコードを実行できるが、顧客がクラウドサービスに求めるものを自動的に提供するわけではない。トレーニングチームは、多数のアクセラレータがあたかも単一のリソースプールのように機能することを必要とする。データは十分な速度でストレージから計算へ届かなければならず、集合通信によってタスクの大部分の時間が待機になるのは避けなければならない。異なるテナントは相互に分離され、スケジューラはどのノード、リンク、デバイスが健全かを把握し、チェックポイントは障害後も保持されなければならない。エンジニアには環境への経路が必要であり、ユーザーには他クラウド、オフィスネットワーク、外部サービスへの接続経路が必要だ。これらの経路が安定的に再現できて初めて、クラウド製品は成立する。

したがって、AI クラウドにおけるネットワークは計算の付属物と見なすことはできない。従来のエンタープライズアーキテクチャでは、ネットワークはサーバーを接続するシステムとして説明されることが多い。分散 AI では、ネットワークは実効計算に直接関与する。同期タスクは、劣化した光モジュール、異常な性能のアクセラレータ、輻輳したレール、または速度の追いつかないストレージ経路によって遅延する可能性がある。タスクが待機している間も、高価なハードウェアの資金調達コストと使用コストは発生し続ける。したがって、ネットワーク設計はベンチマークだけでなく、資金調達された GPU 時間の一時間一時間が価値を生むかどうかにも影響する。

CoreWeave が研究に値するのは、この関係を特に明確に示しているからだ。同社は GPU を一般的なクラウドカタログの中の小さなサービスのひとつとして扱うのではなく、アクセラレータインフラに特化しているため、公開資料ではラックネットワーク、DPU、ベアメタルオーケストレーション、マネージドスーパーコンピューティング、専用線接続、障害修復について比較的詳細に論じられている。これらの資料は設計意図と製品アーキテクチャを証明するものだが、すべてのサイト、すべてのハードウェア世代、すべての顧客展開の完全な地図ではない。

本当に有用な問いは、CoreWeave が抽象的な意味で「より速いネットワーク」を持っているかどうかではなく、AI ワークロードが信頼できるサービスになるまでに何種類のネットワークが連携して動作する必要があるのか、そして各層を誰が制御しているのかということだ。

「CoreWeave ネットワークスタック」が実際に指すもの

この呼称は編集上の総称であり、独立した法人でも、単独で販売される SKU でもない。法的・経済的な事業主体は CoreWeave, Inc. であり、ニュージャージー州 Livingston に本社を置き、Nasdaq に CRWV として上場するデラウェア州の会社である。ネットワークスタックは、より大きな CoreWeave Cloud Platform の一部であり、後者にはコンピューティング、ストレージ、オーケストレーション、マネージドサービスも含まれる。

名称の違いは層の違いに対応する。Nimbus は CoreWeave の DPU ベースの仮想ネットワークアーキテクチャだ。CoreWeave Kubernetes Service(CKS)はベアメタル上のマネージド Kubernetes を提供する。SUNK はインフラストラクチャと運用をマネージドスーパーコンピューティングサービスとしてパッケージ化する。Mission Control は監視、修復、ライフサイクル管理を追加する。Direct Connect は顧客向け専用線接続を提供する。NVLink、NVSwitch、Quantum、Spectrum-X、BlueField は CoreWeave が統合する NVIDIA の技術であり、CoreWeave 自身が発明したプロトコルやハードウェアではない。

これらの層を分けて考えることで、二つのよくある誤りを避けられる。第一の誤りは、プラットフォーム内のすべてのプロトコルとデバイスを CoreWeave の功績とすることだ。同社の貢献は主に、システム統合、資格検証、運用、そしてサプライヤー技術を中心としたクラウドソフトウェアの構築にある。第二の誤りは、各 GPU から各顧客まで届く単一の統一ネットワークを想像することだ。ラック内のスケールアップリンク、ラック間のトレーニングネットワーク、ストレージネットワーク、VPC オーバーレイ、管理経路、大西洋横断バックボーンは、異なる役割を担い、異なる遅延目標と障害ドメインを持ち、単一の帯域幅の数字で要約することはできない。

同じ区別は資産の所有権にも当てはまる。CoreWeave は多くの設備を展開・運用しているが、同社の書類にはリース、第三者データセンター、電力コミットメント、ファイバー協力、設備融資も記載されている。あるサービスが運用上高度に統合されていても、CoreWeave が建物、公益事業、すべての長距離回線、またはラック内のすべてのコンポーネントを所有していることを意味するものではない。「垂直統合」は、層をまたぐ調整を意味する場合にのみ意味を持ち、完全な自給自足と同一視してはならない。

Atlantic Crypto から専用コンピューティングクラウドへ

CoreWeave は 2017 年に The Atlantic Crypto Corporation として設立され、初期は GPU で暗号通貨ワークロードを実行していた。同社は 2018 年 9 月に LLC からデラウェア州法人に転換し、2019 年 12 月に CoreWeave へ改名して、専用クラウドコンピューティングに軸足を移した。

この歴史は「マイニングから AI への転身」という単純なストーリーとして書かれることがあるが、より重要なのは運用能力の連続性だ。どちらの事業も、アクセラレータの調達、電力の確保、高密度ハードウェアの保守、未活用リソースへのワークロードの誘導を企業に要求する。CoreWeave は完全なクラウドプラットフォームを形成する前に、まずアクセラレータ資産ポートフォリオの調達と活用の経済学を学んだ。

この区別は重要だ。需要の変化が自動的にクラウドプラットフォームを生み出すわけではないからである。マイニングのワークロードは通常、比較的反復的で、単純な資産スケジューリングに耐えられる。一方、視覚効果、機械学習、HPC には、異なるソフトウェア、データ移動、分離、サービス保証が必要だ。CoreWeave は、外部の顧客が自分のものではなく、直接見ることもできないリソースを信頼できるようにするため、一連の制御層を追加しなければならなかった。

2020 年代初頭、同社は専用コンピューティング、ストレージ、Kubernetes サービスを構築した。ベアメタル Kubernetes が主要なインターフェースのひとつとなり、顧客は従来の仮想マシン層を経由せずに、アクセラレータサーバー上で直接コンテナをスケジュールできる。2023 年末時点で CoreWeave は 10 のデータセンターと約 70MW の稼働電力を開示しており、2024 年末には 32 のデータセンターと 360MW 超に増加した。

拡大はネットワーク問題の性質を変えた。10 サイトの運用者なら専門家の経験とローカルな例外に大きく依存できる。しかし、30から40のサイトを持つクラウドには、再現可能な設計、ソフトウェア制御のポリシー、統一された資格検証、共有監視、そしてハードウェア世代をまたいで顧客を移行しても運用の一貫性を壊さない能力が必要だ。規模は、エンジニアリング上の選択をガバナンス上の問題に変える。誰が変更を承認できるのか、例外がどのくらい早く発見されるのか、新しい各サイトが本当に意図した制御境界を再現しているのか。

CoreWeave は 2025 年 3 月に IPO を完了した。上場は株式資金をもたらしただけでなく、目論見書と SEC 書類をもたらし、外部が施設、顧客集中度、債務、リース、相互接続アーキテクチャ、リスクを把握できるようにした。ネットワークスタックは、技術システムとしても、上場企業の資本コミットメントとしても分析できる。

ワークロードがアーキテクチャを決める

大規模モデルのトレーニングは計算を複数のアクセラレータに分散させ、局所的な結果を継続的に交換する。具体的な通信パターンはモデルアーキテクチャ、並列方式、ソフトウェアに依存するが、インフラストラクチャの問題は比較的安定している。リソースプールの実効速度は、ローカル計算と集合通信の両方に依存する。ネットワークの総スループットが高くても、輻輳、トポロジ、テールレイテンシが同期ポイントを遅らせれば、高価な計算能力は無駄になる。

プラットフォームは、集合通信の特性を持たないトラフィックも運ぶ。データセットが環境に入り、チェックポイントが GPU メモリからストレージに書き込まれ、制御システムがタスクとポリシーを配布し、エンジニアがログを取り出し、推論サービスが外部にエンドポイントを公開し、バックアップとレプリカが地域をまたいで移動する可能性がある。それぞれのトラフィックの遅延とパケット損失に対する許容度は異なる。これらを同一の無差別ネットワークとして扱えば、性能は予測しにくくなり、障害の分離も難しくなる。

ここから階層設計が生まれる。スケールアップリンクはラックレベルシステム内に密結合ドメインを形成し、スケールアウトファブリックはラックを接続する。ストレージ経路はワークロードにデータを供給し状態を保存し、テナントネットワークはプライベートアドレスとポリシーを提供する。管理ネットワークは運用者がホスト、DPU、スイッチ、修復プロセスを制御できるようにし、バックボーンはサイトと外部エコシステムを接続し、顧客専用線は CoreWeave を他の管理ドメインに接続する。

これらの層は相互に作用するが、互いに置き換えることはできない。長距離ファイバーはローカル GPU ファブリックを置き換えられない。伝搬遅延そのものが、遠く離れたサイト間での強同期トレーニングを制限するからだ。NVLink ドメインは顧客 VPC ではない。オーバーレイはアドレスの違いを隠せても、アンダーレイの故障した光モジュールを修復できない。デバイスプラグインとトポロジ情報がなければ、Kubernetes は各レールと各スイッチ経路を自動的に理解しない。

したがって、このアーキテクチャは本質的に「意図の変換チェーン」だ。顧客はクラスター、ネームスペース、ネットワーク、タスクを要求し、CoreWeave の制御システムはその要求を利用可能なサーバー、ファブリック、ストレージ、ポリシーにマッピングする。Nimbus は VPC の意図を DPU とアンダーレイの状態に変換し、Kubernetes と Slurm 関連サービスはワークロードの意図をノードとアクセラレータの割り当てに変換し、Mission Control は健全性シグナルを修復アクションに変換する。顧客が見るのはひとつのサービスだが、プラットフォームはこれらの各変換を一貫させなければならない。

ラックレベルドメイン内のスケールアップネットワーク

スケールアップネットワークは、高度に統合されたシステム内部のアクセラレータを接続する。NVIDIA のラックスケール設計では、NVLink が GPU 間の高帯域幅通信を提供し、NVSwitch がローカルドメイン内でスイッチングを担う。CoreWeave は特定のシステムと世代でこれらの技術を統合する。

重要なのはブランドだけでなく、物理的な近接性だ。スケールアップドメインにより、モデルシャーディングと集合通信は毎ステップ通常のデータセンターネットワークを経由する必要がなくなり、ラックは独立したサーバーの集合というより、1 台の大型アクセラレータシステムのように振る舞う。同時に、独立した障害ドメインも形成する。ラック内のスイッチ、ケーブル、冷却、コンポーネントの問題は、スケジューラが本来連携して動作すべきと考える複数の GPU に同時に影響する可能性がある。

CoreWeave の目論見書は、一部のクラスター構成では最大 3,200Gbps のノンブロッキング GPU 相互接続帯域幅を提供できると説明していた。「一部のクラスター構成」が最も重要な限定語だ。この数字は普遍的な SLA ではなく、すべてのサイトや世代を説明するものでもない。実際のワークロードが得る帯域幅は、ソフトウェア、トポロジ、メッセージパターン、完全な経路の健全性にも依存する。

スケールアップはひとつのボトルネックを緩和するが、別の場所で密度を高める。アクセラレータの増加とローカル帯域幅の向上は、ラックの電力、冷却、保守性への要求を高める。計算密度が上がっても熱設計と運用設計が追随しなければ、システムは保守が難しくなり、ボトルネックがスケールアウトとストレージに移動する可能性がある。アーキテクチャは、最大仕様の羅列ではなく、コンポーネント間のバランスとして理解されなければならない。

スケールアウトファブリック:InfiniBand と Ethernet の併存

タスクがスケールアップドメインを越えると、スケールアウトファブリックに入る。CoreWeave の文書と技術資料は、NVIDIA Quantum-2 InfiniBand、Quantum-X800 XDR 800G ファブリック、RoCE と RDMA を使う Spectrum-X Ethernet に言及している。InfiniBand と Ethernet が同時に存在することが重要だ。CoreWeave はプラットフォームを単一のプロトコルファミリーに固定していない。

密結合クラスター向け InfiniBand

InfiniBand は低遅延・リモートダイレクトメモリアクセス(RDMA)通信を対象とし、HPC 分野で長い実績がある。AI クラスターでは、通常のホスト処理のオーバーヘッドを減らし、アクセラレータホスト間でデータを移動できる。NVIDIA Quantum システムはさらにスイッチングと集合通信関連の機能を提供する。CoreWeave はこれらのファブリックをクラスターサービスに統合しており、InfiniBand を独立した通信サービスとして販売しているわけではない。

公開資料は、すべてのトポロジ、オーバーサブスクリプション比率、適応ルーティング戦略、顧客サービス境界を開示しているわけではない。「ノンブロッキング」は特定の設計にのみ当てはまり、フリート全体には当てはまらない可能性がある。ネットワークが適切に設計されていても、光モジュールの劣化、不適切なタスク配置、不均等なトラフィック、ソフトウェアのホットスポットによって損なわれる可能性がある。買い手は、自分が得るクラスターが具体的にどのハードウェア世代、どのトポロジ、どの資格検証セットを使うのかを尋ねるべきだ。

Spectrum-X と RoCE による Ethernet 経路

Spectrum-X は NVIDIA の AI 向け Ethernet ネットワークプラットフォームだ。RoCE は Ethernet 上で RDMA セマンティクスを伝送し、アプリケーションが直接メモリ通信を行えるようにしつつ、運用者は Ethernet ファブリックを維持できる。CoreWeave は Spectrum-X を使用し、このエコシステムを中心に設計されたワークロードとハードウェア世代向けに、もう一つのスケールアウト経路を提供する。

Ethernet に慣れていることは、運用の単純さを意味しない。RoCE の性能は、輻輳制御、キューの設計、パケット損失の挙動、テレメトリ、エンドツーエンドのチューニングに依存する。ネットワークはおなじみの Ethernet フレームを使っていても、ヘッドオブラインブロッキング、インキャスト、集合通信の不安定さを避けるには専門的なエンジニアリングが依然として必要だ。統合クラウドの価値は、チューニング責任の多くをプロバイダーに移すことにある。対応するリスクは、顧客がこれらの選択を直接見えにくいことだ。

レール最適化トポロジとタスク配置

マルチレールシステムは、対応する NIC とアクセラレータをグループ化し、集合トラフィックが比較的規則的な並列経路を流れるようにする。レール最適化は、不要なネットワークセグメント間トラフィックを減らし、帯域幅をより予測可能にするが、スケジューラが物理トポロジを理解することも要求する。誤ったノードの組み合わせは設計上の利点を打ち消す。

レールは障害も集中させる。ひとつのレールが劣化すると、他のインターフェースが健全でも、それを使用するすべてのノードがストラグラー(遅延ノード)になる可能性がある。運用システムは、単一サーバーの障害と共有ネットワークの障害を区別しなければならない。これが、ポートレートと同様に、トポロジのテレメトリ、資格検証、修復が重要である理由だ。

Nimbus はクラウド境界を DPU に移す

高性能クラスターファブリックは、自動的にマルチテナントクラウドを形成するわけではない。顧客には、プライベートアドレス、ルーティング制御、インターネットアクセス、分離も必要だ。CoreWeave の答えは Nimbus、すなわち VPC 機能を DPU にオフロードする仮想ネットワークアーキテクチャである。公開文書は NVIDIA BlueField-3 DPU に言及し、セキュリティアーキテクチャの中で VRF、VXLAN、EVPN Type 5 ルーティングを説明している。

DPU は、顧客が制御する計算とプロバイダーが制御するインフラの間に位置し、極めて機微な立場にある。DPU は仮想ネットワークトラフィックを処理し、セグメンテーションを実施し、ホスト CPU をワークロードのために解放できる。また、テナント分離の境界を、顧客が制御し得るオペレーティングシステムの外側に置くこともできる。したがって、これは性能上の選択であると同時にセキュリティ上の選択だ。

VPC オーバーレイの構成

VRF はひとつのルーティングドメインを別のドメインから分離する。VXLAN は共有物理アンダーレイ上でテナントセグメントを伝送する。EVPN は到達可能性を配布し、Type 5 ルートは MAC アドレスだけでなく IP プレフィックスもアドバタイズできる。これらのメカニズムが組み合わさることで、CoreWeave は共有物理インフラ上でプライベートネットワークを提供できる。

オーバーレイはアンダーレイへの依存をなくさない。物理的な到達可能性が失われれば、仮想ネットワークも同様に失敗する。ルート配布の誤りは、分離や接続性を大規模に壊す可能性がある。DPU イメージやポリシーシステムに欠陥があれば、誤った状態が多数のホストに急速に広がる可能性がある。クラウドの抽象化は複雑さを顧客側からプロバイダー側に移すが、複雑さを消し去るわけではない。

DPU がトラストルートの一部になる

Nimbus はプロバイダーのネットワーク機能と顧客ホストをより良く分離するが、DPU のファームウェア、セキュアブート、鍵、ポリシー配布、ログ、リカバリの重要性も高める。分離を実施するデバイスは、可観測でパッチ適用可能でなければならず、同時にテナント環境への制御不能な経路になってはならない。

この制御境界は障害調査にも影響する。接続性の問題は、顧客のワークロード、Kubernetes ポリシー、VPC 設定、DPU ソフトウェア、EVPN コントロールプレーン、物理ファブリックのいずれかに起因する可能性がある。サポートチームは層をまたぐ証拠を必要とするが、あるテナントが別のテナントのデータを見ることはできない。公開資料は意図した設計を説明しているが、フリート全体で独立に検証された分離障害や修復時間の記録は提供していない。

ベアメタル Kubernetes が顧客のコントロールプレーン

CoreWeave Kubernetes Service はベアメタルインフラ上でマネージド Kubernetes を提供し、コンテナプラットフォームと GPU サーバーの間に従来の仮想マシン層を挟むことを避ける。各クラスターは独立した VPC を取得し、分散ワークロード向けの高性能ネットワークとストレージが統合される。

ベアメタルは抽象化の層をひとつ減らすが、単純さを意味しない。Kubernetes は依然として GPU の発見、デバイスの公開、クォータの執行、Pod の配置を行い、ネットワークとストレージのプラグインと連携する必要がある。プラットフォームは、ノードイメージ、ドライバ、ファームウェア、コンテナランタイム、クラスターアップグレードを、基盤となるハードウェア世代と調整しなければならない。顧客はおなじみの API を得るが、CoreWeave はより複雑な互換性マトリクスを引き受ける。

Kubernetes が決定できることとできないこと

Kubernetes は、スケジューラが持つ情報とポリシーに基づいて Pod の配置を決定できるが、各レール、光モジュール、スイッチ経路、集合通信の状態を自動的に理解するわけではない。CoreWeave は、論理的なスケジューリングが実現可能な物理リソースと一致するよう、デバイスプラグイン、オペレーター、トポロジ情報、運用制御を追加する必要がある。

ネットワークポリシーにも範囲がある。Kubernetes のポリシーはワークロード間のトラフィックを制限できるが、VPC と DPU はより広いテナントとルーティングの境界を提供する。ポリシーオブジェクトが存在することは、実際のパケット経路が意図したルールを執行することを意味しない。設定、実装、観測は一貫していなければならない。

SUNK がクラスターをマネージドスーパーコンピュータにする

SUNK は、インフラストラクチャ、高性能ファブリック、ワークロードオーケストレーション、CoreWeave の運用を組み合わせた、本番環境向けマネージドスーパーコンピューティングサービスとして位置づけられている。大型の専用環境を得たいが、完全な施設と運用チームを自前で構築したくない顧客にサービスを提供する。

これは責任分担を変える。顧客は依然としてモデルアーキテクチャ、コード、データ、タスク戦略に責任を持つが、ハードウェアライフサイクル、クラスター資格検証、障害処理の多くは CoreWeave に移る。これは、完全に交換可能なインスタンスのプールというよりも、クラウド時代の契約とソフトウェアで提供されるマネージド HPC 施設に近い。

Mission Control が運用を製品にする

Mission Control は監視、保守、修復、ライフサイクルサポートを追加する。タスクが大きいほど、その重要性は高まる。小さなサーバープールで部品を交換しても影響は限定的だが、高度に同期したリソースプールで劣化したリンクを診断できるかどうかは、数千時間分のアクセラレータ時間が価値を生むかどうかを左右する可能性がある。

CoreWeave の資料はプロアクティブな監視と運用介入を説明しており、これは意図したモデルを証明するものだが、独立に検証された稼働時間(アップタイム)でも、公開された平均修復時間の分布でもない。信頼性が、顧客が自前クラスターではなくプロバイダーを選ぶ重要な理由である以上、完全な障害記録の欠如自体が重要な情報の境界だ。

ストレージはネットワーク化された計算の一部

トレーニングデータ、チェックポイント、モデル成果物はストレージ経路を通過し、ワークロード全体を制約する可能性がある。GPU 間の帯域幅が極めて高くても、入力の読み取り、チェックポイントの書き込み、状態の回復が十分に速くなければ、クラスターは停滞する。CoreWeave プラットフォームにはオブジェクトストレージとファイルストレージが含まれ、高性能なデータ移動がサービスの構成要素として説明されている。

チェックポイントのトラフィックには特殊なパターンがある。多くのワーカーが同時に状態を保存する可能性があり、集合通信とは異なるバースト的なトラフィックを形成する。ストレージがトレーニングファブリックと物理リソースを共有する場合は、分離または容量計画が必要だ。独立したネットワークを使う場合でも、プラットフォームは両方の経路での障害とリカバリを調整する必要がある。

ストレージは移行可能性にも影響する。モデルを CoreWeave に移行するには、他クラウドやプライベート環境から大量のデータを転送する必要があるかもしれない。移出には費用、時間、契約上の摩擦が生じる可能性がある。「Zero Egress Migration」は、特定の移入コストを下げるための CoreWeave の商業的メカニズムであり、技術的な性能保証でも、すべての出方向トラフィックが無料であることや、データ移動に運用コストがないことを示すものでもない。

したがって、顧客はエンドツーエンドの証拠を要求すべきだ。ピーク時のアクセラレータやネットワークの結果には価値があるが、本番タスクにはデータ準備、チェックポイント、モデルレジストリ、ログ、リカバリも含まれる。単一層だけをテストするベンチマークは、完全なタスクがいつ完了し、総コストがいくらになるのかに答えられない。

バックボーンは地域をつなぐものであり、同期型スーパーコンピュータではない

CoreWeave は、陸上と海底ファイバーで北米と欧州のデータセンターを接続するキャリアグレードのバックボーンを説明し、直接ピアリングと専用線接続を提供している。同社の文書は、サイトと可用性に応じて 10、100、400Gbps の Direct Connect を挙げている。

バックボーンの役割はローカルスケールアウトファブリックとは異なる。バックボーンはデータセット、レプリカ、チェックポイント、制御、推論トラフィックを運び、ユーザーや他クラウドと接続し、リカバリと配信を支える。長距離の伝搬遅延により、遠隔の施設を強同期トレーニング用の低遅延クラスターネットワークに変えることはできない。

専用線接続がひとつの不確実性を減らす

専用回線は公共インターネットのルーティング変動を減らし、容量とサポートの境界を明確にするが、完全にプライベートなエンドツーエンドの世界を作り出すわけではない。顧客のアクセスはキャリア、クロスコネクト、データセンター事業者に依存する可能性がある。クラウドのオンランプには独自の承認と設定がある。各ロケーションの経路多様性と資産所有権も完全には開示されていない。

したがって、CoreWeave を Tier-1 キャリアと呼ぶことはできない。同社はバックボーンを運用しピアリングに参加しているが、既存の証拠は、全世界での決済不要の到達可能性や、すべてのファイバー経路の所有権を証明していない。その強みは、自社の計算リソースとの深い接続にあり、世界の通信エコシステムを置き換えることではない。

リージョン設計が異なる可用性を生む

2025 年末時点で、CoreWeave は 6か国に施設を持つ。この数字は、あらゆるアクセラレータ世代、ファブリック、サービス、専用線レートがすべての国で利用可能であることを意味しない。電力、冷却、ネットワーク、ハードウェア、運用検収は同時に完了しないため、リージョンは段階的に稼働する。

地理的要因は遅延だけでなく、データガバナンス、他クラウドへの近接性、人材、電力源、障害の相関、誰がローカル経路を制御するかにも関わる。CoreWeave にとって、国に入るたびに、法務、公益事業、サプライチェーンの調整が増える。ネットワーク拡大は運用モデルであり、均質なボックスの地図ではない。

信頼性が資本を有効な時間に変える

タスクが実行中でも待機中でも、CoreWeave のハードウェア資金調達コストは発生し続ける。したがって、信頼性は財務上の変数だ。ファブリック障害、GPU の劣化、ストレージの停止、スケジューリングの誤りは、課金可能で有効な産出を減らすが、利息、リース、電力の義務は止まらない。

ストラグラーは完全障害より対処が難しい

完全に機能しないノードは発見しやすいが、ストラグラーはオンラインと表示されたまま、すべての同期ポイントを遅らせる可能性がある。大規模タスクには、二値の健全性状態だけでなく、性能劣化を検出するテレメトリが必要だ。スケジューラと運用チームは、コンポーネントをドレインするか、交換するか、使い続けるかを決定しなければならない。

公開情報は、タスク失敗率、テールレイテンシ、ストラグラーの分布を完全には開示していない。これは信頼性が低いことを証明するものではないが、独立した比較を制限する。顧客は、契約、ワークロードテスト、自社の運用記録に依存する必要があり、アーキテクチャ図から直接結論を導くことはできない。

資格検証はシステムテスト

クラスターを顧客に開放する前に、CoreWeave はサーバー、スイッチ、光モジュール、ケーブル、ファームウェア、ドライバ、ストレージ、オーケストレーションを統合的に検証しなければならない。起動できるだけでは不十分だ。有意義なテストは、完全なトポロジが意図したワークロードを継続的に支えられ、障害後に回復でき、修復が新たな不整合を生み出さないかどうかだ。

資格検証も時間とともに変化する。あるソフトウェアとファームウェアの組み合わせがテストに合格しても、アップグレード後も完全に同じであるとは限らない。NVIDIA の新世代が急速に到来するため、CoreWeave は旧契約環境へのサービスを続けながら、より多くの組み合わせをサポートしなければならない。運用の成熟度とは、この重複の中で一貫性を維持することであり、各サイトを特殊事例にすることではない。

資金調達もアーキテクチャの一層

CoreWeave の 2025 年収益は 51億ドル、純損失は 12億ドル、通年の固定資産の現金購入支出は 103億ドル、年末の残存履行義務は 607億ドルだった。同じ文書で、大規模な設備融資、債務、リース、インフラへのコミットメントも開示されている。

これらの数字は意味が異なる。収益は認識済みのサービス収益だ。固定資産購入のキャッシュフローは投資支出であり、フリート全体の評価額ではない。純損失は、高速成長がまだ連結ベースの利益をもたらしていないことを示す。残存履行義務は、会計ルール上の将来の契約義務を表し、銀行の現金でも、すでに提供されたサービスでもない。

2026年第1四半期は需要と保有コストを同時に示す

2026年3月31日までの四半期に、CoreWeave は収益 20.78億ドル、純損失 7.40億ドル、利息支出 5.36億ドルを開示し、自社定義によるバックログ 994億ドルを開示した。需要の可視性と重い資金調達コストが同じ四半期に同時に現れている。

バックログと年末の残存履行義務は、定義と時点が異なり、直接に交換できない。どちらも将来の契約需要を指すが、収益に変換するには、CoreWeave はまず施設、電力、ハードウェア、ネットワークを稼働させ、契約を履行する必要がある。バックログが大きいほど、伴う納入義務も大きくなる。

GPU 担保融資が資産と契約を結ぶ

CoreWeave は、担保付き融資、設備融資、顧客支援による仕組みで拡大している。2026 年 6 月、同社は 85億ドルの融資枠を発表し、この取引を GPU 担保・投資適格格付と説明した。これは展開能力を拡大するが、収益ではなく、同社の全債務が投資適格であることを意味するものでもない。

資産融資は、債務、ハードウェア、契約キャッシュフローを整合させることができるが、担保、展開、資金使途も制限する。アクセラレータ、スイッチ、光モジュールは、従来のインフラよりも急速に減価する。このモデルが最も頑健なのは、稼働率が高く、顧客契約が設備の経済的価値が最も強い期間をカバーする場合だ。

したがって、ネットワーク設計は信用の質に影響する。稼働率を高めるトポロジは、資金調達された資産の産出を増やす。サイトの遅延、長期的なストラグラー問題、移行の失敗は産出を減らす。CoreWeave にとって、システムエンジニアリングとバランスシートエンジニアリングは同じ問題だ。

顧客集中度もインフラ依存の一種

マイクロソフトは CoreWeave の 2025 年収益の 67% を占める。アンカー顧客は需要を証明し、資金調達を支え、プロバイダーが先行的に調達することを可能にするが、同時に顧客の交渉力を強め、稼働率をひとつの商取引関係に極めて敏感にする。

CoreWeave はまた、Meta、Anthropic などの顧客との関係を開示または発表している。Flow Traders は 2026 年 7 月、基盤モデルのトレーニングに CoreWeave を選んだ。Leidos は、防衛、国家安全保障、インテリジェンス任務向け AI を提供するための提携を発表した。関連情報源は、記述された契約、選定、提携を証明できるが、集中度が消えたことや、発表された容量がすべて稼働したことを証明するものではない。

Take-or-pay 契約はリスクを移すが、なくしはしない

複数年の take-or-pay 契約は需要の可視性を高め、資金調達を支えることができる。支払いが短期的な消費に完全に依存するわけではないため、稼働率リスクの一部を顧客に移す。しかし、建設、電力、納入、性能、信用、再交渉のリスクは残る。

顧客にとって、このような契約はクラウドの約束の一部を反転させる。従来のパブリッククラウドは弾力性と低いコミットメントを強調する。専用 AI クラスターは、プロバイダーが顧客向けに特定の容量を建設または確保するため、より長期の、インフラプロジェクトに似た関係を要求する可能性がある。インターフェースはクラウドソフトウェアのように見えるが、基盤の経済はプロジェクトファイナンスに近い。

防衛・規制対象ワークロードが保証のハードルを上げる

2026年7月30日に発表された Leidos との提携は、プラットフォームを防衛・インテリジェンス任務に向かわせる。提携自体は、すべての認可、認定、展開許可を得たことを証明するものではないが、サプライチェーン管理、監査、情報セキュリティ、運用継続性がより重要な製品要素になる可能性を示している。

DPU による VPC、専用線接続、マネージド運用は高保証設計を支えることができるが、プロジェクト固有の管理、人員要件、データ処理規律、政府の承認を置き換えることはできない。任務に敏感なワークロードに近づくほど、責任の境界の透明性が必要になる。

ソフトウェア買収は上流へ、失敗した合併は下流の施設へ

2025 年、CoreWeave は Weights & Biases、OpenPipe、marimo、Monolith AI を買収した。Weights & Biases はモデル開発と可観測性ツールを加え、他の取引は推論、ノートブック、産業 AI の能力を拡張する。これにより同社はインフラから開発ライフサイクルの上流へと広がった。

戦略的論理は明快だ。モデルワークフローをより理解するプロバイダーは、需要をより良く予測し、インフラの利用障壁を下げ、より多くの段階で顧客を引き留められる。統合リスクも同様に明快だ。ソフトウェア事業のリリースサイクル、利益構造、文化は、高資本のデータセンターとは異なる。CoreWeave が、顧客がかつて独立ベンダーから得ていたツールを自社で持とうとすれば、製品の重複やパートナーとの衝突が生じる可能性がある。

Core Scientific の買収計画は物理層を指し示す。CoreWeave は 2025 年 7 月に合併契約を発表し、データセンター容量とリース経済の支配強化を目指した。Core Scientific は株主投票の後、2025年10月30日に契約を終了した。CoreWeave は Core Scientific を買収していない。

二種類の取引は双方向の統合を示す。上流では開発者向けソフトウェアへ、下流では物理容量の支配へ向かう。失敗した合併は、インフラ支配がテクノロジープラットフォームが望む速度で常に買えるわけではないことも示している。株主、規制、資金調達、契約構造が垂直統合を妨げる可能性がある。

CoreWeave が制御できるものとできないもの

CoreWeave は、顧客プラットフォーム、多くの設計上の選択、デバイスの資格検証、オーケストレーション、運用プロセスを制御する。Nimbus が VPC をどうマッピングするか、クラスターをどう提示するか、どのサービスを自社でホストするか、障害をどう処理するかを決定できる。また、ハードウェアを先行調達し、アクセラレータ密度を中心に施設を編成することもできる。

NVIDIA は、GPU、NVLink、InfiniBand、Spectrum-X、BlueField の主要ロードマップを制御する。公益事業とデータセンターパートナーは電力と施設納入の一部を制御する。ファイバーキャリア、エクスチェンジ、クラウドは外部接続を制御する。貸し手と設備融資者は資本を制約し、大口顧客は契約を通じて容量計画に影響を与える。

これは CoreWeave に固有の欠陥ではなく、すべてのクラウドがサプライチェーンに依存している。特に重要なのは、CoreWeave の差別化が NVIDIA 新システムの迅速な展開と密接に結びついており、資本コミットメントが同社の運営歴に比べて非常に大きいからだ。ひとつのサプライヤーの遅延やロードマップ変更は、顧客への納入と資金調達に波及する可能性がある。

プラットフォームの利点はこれらの境界の調整にあり、リスクは相関依存にある。同じ世代のサプライヤー製品、同じサイト設計、同じ顧客計画が複数の層に同時に影響する可能性がある。統合は顧客が管理すべき契約数を減らすが、プロバイダーレベルの障害の影響を増幅する可能性がある。

競争上の位置づけ:専用クラウドは責任配分の選択

CoreWeave は、ハイパースケールクラウド、他の GPU 専用クラウド、顧客自前のクラスター、コロケーション・マネージド・統合の組み合わせと競合する。比較は GPU 数や単一のベンチマークだけではできない。買い手は、ハードウェア世代、ファブリック、ストレージ、スケジューリング、専用線、サポート、契約期間、地理、データ移動の総コストを比較する。

ハイパースケールクラウドとの比較

AWS、Microsoft Azure、Google Cloud、Oracle は、より広いサービス、グローバルエコシステム、より大きなバランスシートを提供し、AI インフラをデータベース、セキュリティ、分析、企業調達と組み合わせられる。CoreWeave の答えは特化だ。特定の NVIDIA 世代をより早く導入し、ベアメタルオーケストレーションを使い、高密度アクセラレータのワークロードを中心にプラットフォームを設計する。

特化は抽象化を減らし、検証を速めるが、より狭いサプライヤーと障害のプロファイルも形成する。顧客はより焦点を絞ったプロバイダーを得る一方、サービスの幅が小さく、資本構成がより若いことを受け入れる。正しい比較は業界ラベルではなく、具体的なワークロードに基づくべきだ。

他の専用クラウドとの比較

Lambda、Nebius、Crusoe などのプロバイダーは、アクセラレータ、クラスター、マネージドサービスで重なるが、地理、エネルギー戦略、ソフトウェア構成、所有権、資金調達、施設管理が異なる。「Neocloud(ネオクラウド)」は単なる市場ラベルであり、共通のアーキテクチャを意味しない。

上場企業の書類により、CoreWeave の規模とリスクは多くの競合より透明だが、技術的・経済的優位性を自動的に証明するものではない。開示が少ない競合は、より小さいか、より効率的か、単により不透明かもしれない。透明性を性能ランキングに変えることはできない。

自前のプライベートクラスターとの比較

自前クラスターは、顧客がハードウェア、データ、運用を直接制御できるようにするが、調達、電力、施設、ネットワーク、ストレージ、セキュリティ、ファームウェア、予備部品、専門人材も要求する。CoreWeave が売るのは、これらの責任の大部分をプロバイダーに移すことだ。

移転は完全ではない。顧客は依然としてワークロードを設計し、データを管理し、ポリシーを設定し、プロバイダーのリスクを評価する必要がある。長期コミットメントは移行の弾力性を減らす。自前クラスターのリスクは内部の利用不足であり、クラウド契約のリスクはプロバイダー依存だ。経済的な選択は、どちらの側が変動を吸収し、高価なシステムを生産的に保つのに適しているかによる。

液冷スイッチが次のボトルネックの移動先を示す

2026 年 7 月、CoreWeave は液冷スイッチアーキテクチャを発表し、ラックあたりのネットワーク帯域幅密度を高められると説明した。この数字は同社固有の設計と計算によるもので、独立したフリート全体のベンチマークではないが、メカニズムは重要だ。アクセラレータ密度が上がると、スイッチと光モジュールの消費電力と発熱がラックの制約になり得る。

スイッチを液体で冷却すれば、制約のあるラック電力とスペースの中でより多くのネットワーク容量を収められ、配線を短縮できる可能性もある。同時に、ネットワーク保守は液冷システムとより緊密に結合する。漏れ、ポンプ障害、修復プロセスは、かつて通常の空冷設備として扱われていたネットワークコンポーネントに影響する可能性がある。

これは、AI インフラのボトルネックが移動することを示している。より速い GPU はより高いスケールアップ帯域幅を必要とし、より高いラック帯域幅はより密なスケールアウトスイッチングを必要とし、より密なスイッチングはより高い電力と冷却の需要をもたらし、新施設は異なる電気機械設計を採用しなければならない。ひとつの製品アップグレードが、データセンター全体の再設計になる可能性がある。

Vera Rubin は将来の移行であり、設置済みフリートの説明ではない

CoreWeave の 2026 年 7 月の資料は、NVIDIA Vera Rubin NVL72 への準備を説明し、Blackwell 比のメガワットあたりトークン数という測定値または将来見通しを示している。これらの言明は CoreWeave と具体的な構成に帰属させるべきであり、調査時点でフリート全体で利用可能であると見なしてはならない。

新世代は、アクセラレータ、スケールアップ、スケールアウト、ラック電力、冷却、ファームウェア、ドライバ、オーケストレーション、資格検証を同時に変える。MW あたりの産出を高めるかもしれないが、旧施設を不適合にし、競争力を低下させるかもしれない。CoreWeave の新ハードウェアの迅速な導入は、移行、稼働率、旧資産の減価償却を管理できる場合にのみ利点となる。

これは NVIDIA 依存も深める。早期アクセスは顧客と高額契約を引き寄せるが、CoreWeave をサプライヤーのタイミング、価格、アーキテクチャ決定にさらす。顧客やソフトウェア層の多様化は、物理スタックの多様化を自動的にもたらさない。

より広いデジタルインフラへの影響

CoreWeave の拡大は GPU レンタルをはるかに超える影響を与える。GW 級のコミットメントは発電、系統接続、変圧器、冷却、土地、建設の需要を増やす。高 radix ファブリックはスイッチ、光モジュール、ファイバーの需要を増やす。専用線はキャリア、エクスチェンジ、クラウドオンランプの需要を増やす。資金調達は、貸し手が長期契約を用いて急速に陳腐化する技術資産を評価することを要求する。

プラットフォームはインターネットトラフィックが現れる場所も変える。密結合トレーニングは主にローカルファブリック内に留まるが、データセット、チェックポイント、モデル成果物、推論リクエスト、開発プロセスは、クラウド、データセンター、ユーザーの間を継続的に移動する。目に見えるインターネットへの影響は、必ずしも巨大なトレーニングフローではなく、トレーニング環境をめぐる長期的なデータ移動である可能性が高い。

施設を抱えるコミュニティと電力網にとって、これは電力と土地の決定だ。調査資料はサイトレベルのデータを欠いており、会社全体の環境結論を支えることはできないが、稼働電力と契約電力が成長の中心指標であり、電力と施設の遅延がビジネスリスクであることを証明できる。

ネットワークエンジニアにとって、このアーキテクチャは AI インフラが独立した専門分野になりつつあることを示している。ルーティングとスイッチングの知識は依然として必要だが、集合通信ライブラリ、アクセラレータトポロジ、液冷、スケジューリング、プロジェクトファイナンスと交差している。輻輳をチューニングする人は、タスク完了率と債務返済能力も守っているのだ。

公開された証拠から見えないもの

CoreWeave は製品ドキュメント、技術ブログ、財務書類を公開しているが、ネットワークスタックは依然として部分的に不透明だ。提供される資料には、完全なリアルタイムトポロジ、サイトごとのファブリック一覧、オーバーサブスクリプション表、ファイバー所有権の地図、完全な障害履歴、独立したワークロード別ベンチマークのアーカイブはない。

この境界は書き方に影響すべきだ。アーキテクチャ文書はメカニズムを証明でき、SEC 書類は連結財務とリスクを証明でき、顧客ニュースは選定や提携を証明できる。しかし、いずれも一般的なワークロードの結果、フリート全体の稼働時間、すべての買い手がより低い総コストを得ることを証明できない。

規模についても同様の注意が必要だ。稼働電力は契約電力と等しくなく、バックログは収益ではなく、予定された決算説明会は決算結果ではなく、発表された顧客契約は利用を意味せず、買収提案は所有権を意味せず、将来のハードウェアは現在のフリートを意味しない。

これらの区別は記事を弱めるものではなく、専門読者が管理しなければならない情報ギャップを定義する。CoreWeave は、高度に統合されているが、重要な詳細が必然的に非公開であるシステムを、顧客と資本に信頼するよう求めている。理性的な対応は、優れているか失敗かと最初から決めつけることではなく、具体的な契約、クラスター、サイトのレベルで証拠を要求することだ。

核心的な判断

CoreWeave の製品はしばしば計算容量と呼ばれるが、より深い製品は実際には調整だ。サプライヤーのロードマップとデータセンター建設、スケールアップとスケールアウト、DPU ポリシーとテナントの意図、Kubernetes スケジューリングと物理トポロジ、ストレージとチェックポイント、バックボーンと顧客アクセス、長期資金調達と短いハードウェアサイクルの間の調整である。

この調整は現実の利点を形成できる。専用プロバイダーは、顧客が複数のベンダーを自分で組み立てることを要求せずに、完全なワークロードを中心に意思決定できる。多くの企業より速くシステムを検証し、障害を修復し、新世代を導入できる。急速な成長は、大口顧客がこの責任移転を実際に重視していることを示している。

同じ統合は結果も集中させる。ひとつのファブリック設計、一度のサプライヤー遅延、ひとつのポリシー誤り、ひとつの資金調達制約、またはアンカー顧客の変化が、システムの大部分に影響する可能性がある。CoreWeave の未来は、目を引く帯域幅の数字ではなく、すべての層が資金調達された容量を継続的に信頼できる顧客ワークに変換できるかどうかにかかっている。