要約

  • CoreWeave のネットワークスタックは、スケールアップ、スケールアウト、ストレージ、テナント、管理、バックボーン、プライベート接続を含み、個別の製品ではなく運用アーキテクチャである。
  • NVIDIA のファブリックと DPU は CoreWeave のソフトウェアと連携し、アクセラレーターのスケジューリング、テナント分離、データ移動を専門クラウド上で実現する。
  • CoreWeave は43のデータセンター、850 MW 超の稼働電力、約3.1 GW の契約済み電力を報告し、2025年の売上高の67%を Microsoft が占めた。これは規模と集中の両方を示す。
  • 鍵となるのは、資金調達コスト、リース、ハードウェアの老朽化、運用の複雑さが増す前に、契約済み電力と受注残を信頼性が高く多様化したサービスに転換することである。

物理的な設備は通常のクラウドリージョン地図から推測されるよりも速く拡大した

2025年12月31日時点で、CoreWeave は43のデータセンター、850 MW 超の稼働電力、約3.1 GW の契約済み電力を報告した。稼働電力とは、同社の定義に基づき当該日時点で稼働していたインフラを指す。契約済み電力は、将来の提供に向けた権利と義務を示すものであり、設置済みキャパシティと誤認してはならない。

その成長曲線は急勾配である。2023年末は10データセンター、約70 MW 稼働。2024年末は32データセンター、360 MW 超稼働。2025年末は43データセンター、850 MW 超稼働。2026年第1四半期には稼働1 GW 超、契約済み3.5 GW 超を報告した。これらの数字は、設備と運用を産業的な速度で拡大しようとする企業の姿を示している。同時に、昨日のアーキテクチャがいかに早く少数派になり得るかも示している。

電力は前提条件であり、完成品ではない。契約で確保された1 MW の電力であっても、送電網接続、発電または系統電力、高密度配電、冷却、建物の準備、ネットワーク経路、アクセラレーターの納品、運用受入検査が引き続き必要となる。一つの段階での遅延が収益を先送りさせる一方、一部の契約は早期に開始される場合もある。

データセンターの形態は混在している。CoreWeave は機器を所有し大規模な設置を管理する一方、賃貸施設やサードパーティプロバイダーも利用している。これにより地理的な拡大を加速し、建物シェルを自前で建設することを回避できる。一方で、賃貸業者のパフォーマンス、建設スケジュール、電力供給、契約条件がプラットフォームの信頼性の一部となる。

GPU があればクラウドになるわけではない

電力が供給されたラック内のアクセラレーターはコードを実行できるが、それだけでは顧客がクラウドに求めるものを提供したことにはならない。トレーニングチームは、共有割り当てのように振る舞う多数のアクセラレーターを必要とする。データは必要なレートでストレージから到着しなければならない。集団演算は、ジョブの大半が通信待ちにならないよう GPU を接続する必要がある。テナントは互いに分離されたままであるべきだ。スケジューラーは、どのノード、リンク、デバイスが正常かを把握していなければならない。チェックポイントは障害を乗り越えねばならない。技術者には環境へのアクセス手段が、ユーザーには他のクラウド、オフィス、サービスへの接続が必要である。これらの経路が再現可能になったとき、初めてクラウド製品が成立する。

それゆえ、AI クラウドにおけるネットワークは計算能力の付属物とみなすことはできない。一般的なエンタープライズアーキテクチャでは、ネットワークはサーバー同士をつなぐシステムと見なされることが多い。しかし分散 AI においては、ネットワークは実効的な計算の直接的な一部となる。同期ジョブは、たった一つの脆弱な光モジュール、低速なアクセラレーター、過負荷のレール、あるいは追いつかないストレージ経路によって遅延し得る。ジョブが待機している間も、未使用のハードウェアに対する課金は続く。したがってネットワーク設計は、ベンチマーク数値だけでなく、資金調達された GPU 時間1時間ごとの経済性にも影響を及ぼす。

CoreWeave のプラットフォームは、この関係性を例外的に明確にしているため、この分析に特に適している。同社はアクセラレーターインフラに特化しており、汎用クラウドの小さなサービスの一つとして GPU を提供しているわけではない。したがって公開資料では、ラックファブリック、データプロセッシングユニット、ベアメタルオーケストレーション、管理型スーパーコンピューター、プライベート接続、修復プロセスについて、単なるインスタンス一覧よりも詳細に記述されている。これらの記述は設計意図と製品アーキテクチャを裏付けるものであるが、すべての拠点、世代、顧客導入事例を網羅した完全な地図ではない。

したがって重要な問いは、CoreWeave が抽象的に見て高速なネットワークを持っているかどうかではない。より有益なのは、AI ワークロードが信頼できるサービスとして稼働するまでに、いくつの異なるネットワークが協調しなければならないのか、そしてそれぞれを誰が管理しているのかという問いである。

「CoreWeave ネットワーキングスタック」という用語が実際に指すもの

この表現は編集上の総称であり、法人格でも単独販売される SKU でもない。法的かつ経営上の事業者は CoreWeave, Inc.であり、デラウェア州で設立され、ニュージャージー州リビングストンに本社を置き、Nasdaq にティッカーシンボル CRWV で上場している。ネットワークスタックは、より広範な CoreWeave Cloud Platform の一部であり、同プラットフォームはコンピュート、ストレージ、オーケストレーション、マネージドサービスも包含する。

異なる名称が異なるレイヤーを指す。Nimbus は CoreWeave の DPU ベースの仮想ネットワークアーキテクチャである。CoreWeave Kubernetes Service(CKS)は、管理型ベアメタル Kubernetes を提供する。SUNK はインフラと運用を統合し、管理型スーパーコンピューターサービスとして提供する。Mission Control は監視、修復、ライフサイクルサポートを追加する。Direct Connect はプライベートな顧客接続を提供する。NVLink、NVSwitch、Quantum、Spectrum-X、BlueField といった名称は、CoreWeave が統合する NVIDIA のベンダー技術であり、同社独自の発明ではない。

この区別は、よくある二つの誤りを防ぐ。第一に、プラットフォーム内のすべてのプロトコルやデバイスを同社の成果とみなすべきではない。CoreWeave の貢献は、サプライヤー技術に関するシステム統合、認定、運用、クラウドソフトウェアにある。第二に、すべての GPU をすべての顧客に接続する単一の統合ファブリックは存在しない。ローカルなスケールアップリンク、ラック間のトレーニングファブリック、ストレージネットワーク、VPC オーバーレイ、管理経路、大西洋横断バックボーンは、それぞれ異なる役割、レイテンシ許容範囲、障害ドメインを持つ。これらを単一の帯域幅数値に集約することはできない。

同様の規律は所有権にも当てはまる。CoreWeave は大規模な設備を導入・運用しているが、提出書類にはリースモデル、サードパーティのデータセンター、電力契約、光ファイバー関係、機器ファイナンスも同様に記載されている。サービスは、CoreWeave が建物、電力会社、長距離回線、あるいはラック内のすべてのコンポーネントを所有していなくても、運用上統合され得る。「垂直統合」という言葉は、多くのレイヤーにわたる調整された管理を意味する場合にのみ有用であり、完全な自給自足を意味するものではない。

Atlantic Crypto から特化型コンピュートへ

CoreWeave は2017年に The Atlantic Crypto Corporation として創業した。初期の事業は GPU 資産を暗号資産ワークロードに活用するもので、2018年9月に LLC からデラウェア州法人に転換された。特化型クラウドコンピューティングへと舵を切った2019年12月に、CoreWeave へと社名を変更した。

その出自は、暗号資産マイニングと人工知能の間の興味深い対比として語られることもある。より重要な連続性は運用面にある。どちらのビジネスモデルも、アクセラレーターの調達、電力の確保、高密度ハードウェアの信頼性の高い運用、そして未使用キャパシティへのワークロード割り当てを必要とする。初期の同社は、クラウドのテナント、ネットワーク、ストレージ、サポートシステムを構築する前に、アクセラレーターフリートの経済性を学んだ。

この区別は重要である。需要の変化が自動的にプラットフォームを生み出すわけではないからだ。マイニングワークロードは比較的反復的であり、単純な資産モデルで対応できる。一方、視覚効果、機械学習、高性能コンピューティングには、異なるソフトウェア、異なるデータ移動、隔離、サービス品質が必要となる。CoreWeave は、自社が所有せず物理的に確認できないリソースを、外部顧客が信頼して利用できるようにするためのレイヤーを追加しなければならなかった。

2020年代初頭、同社は特化型のコンピュート、ストレージ、Kubernetes サービスを開発した。ベアメタル Kubernetes は重要なインターフェースとなった。顧客は従来の仮想マシンレイヤーを経由することなく、コンテナ化されたワークロードを直接アクセラレーターサーバー上でスケジューリングできるようになった。2023年末に CoreWeave は10データセンター、約70 MW の稼働電力を報告し、2024年末には32データセンター、360 MW 超となった。

この拡大はネットワーク課題の性質を変えた。10拠点の運営者は、依然として専門知識とローカルな例外に大きく依存できる。しかし30~40拠点のクラウドには、再現可能な設計、ソフトウェア駆動のポリシー、共通の認定、統一された監視、そして運用の一貫性を損なうことなく顧客をハードウェア世代間で移行させる方法が必要である。規模の拡大は、優れた技術的決定をガバナンスの問題へと変換する。すなわち、誰が変更を承認できるか、例外がどの程度迅速に検出されるか、そして新しい拠点が意図されたコントロール境界を本当に再現しているか、といった問いである。

CoreWeave は2025年3月に新規株式公開(IPO)を完了した。上場は資本をもたらしただけでなく、目論見書や SEC 提出書類を通じて、施設、顧客集中、負債、リース、接続アーキテクチャ、リスクに関する確かな証拠を生み出した。これにより、ネットワークスタックを技術システムとしても、上場企業のコミットメントとしても検証できるようになった。

ワークロードがアーキテクチャを決定する

大規模モデルのトレーニングでは、計算がアクセラレーターに分散され、部分的な結果が継続的に交換される。正確な通信パターンはモデルアーキテクチャ、並列化、ソフトウェアに依存するが、インフラ上の課題は変わらない。割り当ての実効速度は、局所計算と同様に集団通信によっても決定される。ファブリックは総合的には高速に見えても、ジョブを結束させる同期ポイントを輻輳、トポロジー、テールレイテンシが遅延させる場合、キャパシティを浪費し得る。

さらにスタックは、集団演算とは異なる振る舞いをするトラフィックにも対応しなければならない。データセットが環境に入り、チェックポイントが GPU メモリを離れてストレージに保存される。コントロールプレーンシステムはジョブとポリシーを分配し、技術者はログを取得し、サービスは推論エンドポイントを提供する。バックアップとレプリカはリージョンをまたぐことがある。トラフィッククラスごとに耐えられる遅延と損失は異なる。これらすべてを未分化な一つのネットワークとして扱えば、パフォーマンスの予測は困難になり、障害の切り分けも難しくなる。

ここから階層化された設計が生まれる。スケールアップ接続は、ラックスケールシステム内に密結合ドメインを形成する。スケールアウトファブリックは複数のラックにまたがって多数のシステムを接続する。ストレージ経路はワークロードにデータを供給し永続化する。テナントネットワークは顧客にプライベートアドレスとポリシーを提供する。管理ネットワークはオペレーターがホスト、DPU、スイッチ、修復フローを制御することを可能にする。バックボーンは拠点と外部エコシステムを結び、プライベートな顧客回線はクラウドを他の管理ドメインに接続する。

これらのレイヤーは協調して機能するが、互換性はない。広域光ファイバーは、伝播遅延だけをとっても、遠隔地間での緊密に同期したトレーニングを困難にするため、ローカル GPU ファブリックを代替できない。NVLink ドメインは顧客 VPC を提供できず、オーバーレイはアドレスの差異を隠蔽できても、アンダーレイで故障した光モジュールを修復できない。Kubernetes は物理的なレールをすべて理解していなくても Pod をスケジューリングできるが、それはプラットフォームがトポロジー情報とデバイス統合を提供する場合である。

したがってアーキテクチャは、翻訳された意図の連鎖である。顧客がクラスター、ネームスペース、ネットワーク、ジョブを要求すると、CoreWeave のコントロールシステムはその要求を利用可能なサーバー、ファブリック、ストレージ、ポリシーにマッピングする。Nimbus は VPC の意図を DPU とアンダーレイの状態に変換し、Kubernetes や Slurm に近いサービスはワークロードの意図をノードとアクセラレーターに変換する。Mission Control はヘルスシグナルを修復アクションに変換する。顧客からはサービスとして見えるが、プラットフォームはこれらの変換を一貫して維持しなければならない。

ラックスケールドメイン内のスケールアップネットワーク

スケールアップネットワークは、緊密に統合されたシステム内でアクセラレーターを接続する。NVIDIA のラックスケール設計では、NVLink が高帯域幅の GPU 間通信を提供し、NVSwitch がそのローカルドメイン内でスイッチングを行う。CoreWeave はこれらのテクノロジーを一部のシステムおよび世代に統合している。

重要なのはブランド名ではなく、近接性である。スケールアップドメインは、モデルパーティションや集団演算が各ステップで通常のデータセンターネットワークを経由することなくデータを交換することを可能にする。これにより、ラックは独立したサーバーの集合体というよりも、一つの大規模なアクセラレーター集合として振る舞うことができる。同時に、独自の障害ドメインも生まれる。ラック内のスイッチ、ケーブル、冷却問題、コンポーネント障害は、スケジューラーが協調動作を期待する多数の GPU に影響を及ぼし得る。

CoreWeave の目論見書では、最大3,200 Gbps のノンブロッキング GPU 相互接続帯域幅を備えた一部のクラスター構成について説明されている。ここで「一部のクラスター構成」という表現が証拠上の重みの大部分を占める。これは一般的なサービスレベルを定めるものでも、すべての拠点やアクセラレーター世代に適用される主張でもない。実際に利用可能な帯域幅はさらに、ソフトウェア、トポロジー、メッセージパターン、全経路の健全性に依存する。

スケールアップ設計は一つのボトルネックを狭める一方で、別の場所の密度を高める。より多くのアクセラレーターとより大きなローカル帯域幅は、ラックあたりの電力、冷却、保守性の要求を増大させる。熱設計や運用計画を適応させずに計算を集中させたシステムは、修理がより困難になったり、ボトルネックをスケールアウトリンクやストレージに移動させたりする可能性がある。アーキテクチャは、最大スペックの羅列ではなく、コンポーネント間のバランスとして読み取られなければならない。

スケールアウトファブリック:InfiniBand と Ethernet の両方が存在する

ジョブがスケールアップの限界を超えると、スケールアウトファブリックに移行する。CoreWeave の公開提出書類や技術文書には、NVIDIA Quantum-2 InfiniBand、800 Gigabit の Quantum-X800 XDR、さらに RoCE および RDMA ベースの Spectrum-X Ethernet が記載されている。InfiniBand と Ethernet の両方が使用されていることは重要である。同社はプラットフォームのアイデンティティを単一のプロトコルファミリーに限定していないのだ。

密結合クラスター向け InfiniBand

InfiniBand は低レイテンシ通信とリモートダイレクトメモリアクセス(RDMA)を重視しており、高性能コンピューティングで長い歴史を持つ。AI クラスターにおいては、通常のホスト処理負荷の一部を回避しながら、アクセラレーターホスト間でデータを転送できる。NVIDIA の Quantum システムは、大規模な同期ワークロードに適合するスイッチング機能や集団通信機能を追加する。CoreWeave は InfiniBand を独立したキャリアサービスとして販売するのではなく、これらのファブリックをクラスター製品に統合している。

公開されている証拠は、すべてのトポロジー、オーバーサブスクリプション比、ルーティングポリシー、サービス境界を開示しているわけではない。「ノンブロッキング」は特定の設計を表すものであり、全ファブリックに当てはまるわけではない。適切に構築されたファブリックでも、脆弱な光学モジュール、不適切な配置、不均一なトラフィック、ホットスポットを生み出すソフトウェアの挙動によって性能が損なわれる可能性がある。したがって購入者は、特定のクラスターにどのハードウェア世代、トポロジー、認定が適用されるのかを確認すべきである。

Ethernet パスとしての Spectrum-X と RoCE

Spectrum-X は、NVIDIA の AI ネットワーク向け Ethernet プラットフォームである。RoCE は RDMA のセマンティクスを Ethernet 上で伝送し、オペレーターが Ethernet ベースのファブリックを維持しながら、アプリケーションがダイレクトメモリアクセスを利用できるようにする。CoreWeave が Spectrum-X を採用することで、このエコシステムに最適化されたワークロードやシステム世代向けの代替スケールアウトパスが提供される。

Ethernet に精通していることを、容易な運用と混同してはならない。RoCE のパフォーマンスは、輻輳制御、キューデザイン、損失特性、テレメトリー、エンドツーエンド構成に依存する。ネットワークは馴染みのある Ethernet フレームを使用していても、Head-of-Line Blocking、Incast、不安定な集団通信性能を回避するためには専門知識を必要とする場合がある。統合クラウドの価値は、プロバイダーがこうした調整の大部分を引き受ける点にある。それに対応するリスクは、こうした決定に対する顧客の直接的な可視性が低いことである。

レール最適化トポロジーと配置

マルチレールシステムは、対応するネットワークインターフェースとアクセラレーターをグループ化し、集団通信トラフィックが規則的な並列パス上を流れるようにする。レール最適化設計は不必要なホップを減らし、帯域幅の予測可能性を高めることができる。同時に、スケジューラーはトポロジーを理解していなければならない。ジョブが誤ったノードの組み合わせに分散されると、物理設計が無効化され得る。

レールは障害を集中させる可能性がある。一つのレールが劣化すると、他のインターフェースが正常でも、そのパス上の全ノードがストラグラーになり得る。運用システムは、故障したサーバーと共有ネットワーク障害を区別できなければならない。そのため、トポロジーを考慮したテレメトリー、認定、修復は、単純なポート速度と同様に重要である。

Nimbus がクラウド境界を DPU に移す

高性能クラスターファブリックだけでは、マルチテナントクラウドにはならない。顧客はプライベートアドレス、経路制御、インターネットアクセス、他テナントからの隔離を必要とする。CoreWeave の答えが Nimbus である。これは VPC 機能をデータプロセッシングユニットにオフロードする仮想ネットワークアーキテクチャである。公開文書では NVIDIA BlueField-3 DPU が挙げられ、セキュリティアーキテクチャにおける VRF、VXLAN、EVPN Type-5 ルートが説明されている。

DPU は、顧客が管理するコンピュートとプロバイダーが管理するインフラの間の特権的な位置に配置される。仮想ネットワークトラフィックを処理し、セグメンテーションを実施し、ホスト CPU リソースをワークロードのために解放できる。さらに、顧客が制御する可能性のある OS の外側でテナント境界を維持することもできる。この分離は、パフォーマンスとセキュリティの両面での判断である。

VPC オーバーレイの構築方法

Virtual Routing and Forwarding(VRF)インスタンスは、あるルーティングドメインを別のドメインから分離する。VXLAN は共有物理アンダーレイ上でテナントセグメントを伝送する。EVPN は到達性を配布し、Type-5 ルートは単一の MAC アドレスだけでなく IP プレフィックスを通知できる。これらのメカニズムにより、CoreWeave は共有物理インフラ上でプライベートネットワークを実現する。

オーバーレイはアンダーレイへの依存を排除しない。物理的な到達性が失われれば、仮想ネットワークも機能しなくなる。経路配布に誤りがあれば、隔離や到達性が大規模に破綻し得る。DPU イメージやポリシーシステムに欠陥があれば、同じ誤った状態が多数のホストに急速に伝播する可能性がある。クラウドの抽象化は、複雑さをプロバイダーインフラに移すことで顧客の負担を軽減するのであって、複雑さそのものを除去するわけではない。

DPU が信頼の基盤の一部に

Nimbus はプロバイダーのネットワーク機能が顧客ホストに露出する範囲を減らす一方で、DPU ファームウェア、セキュアブート、鍵、ポリシー配布、ロギング、リカバリの重要性を高める。隔離を実施するデバイスは、それ自体がテナント環境への制御不能な経路となることなく、観測可能かつパッチ適用可能でなければならない。

この制御境界はトラブルシューティングにも影響する。接続問題は、顧客のワークロード、Kubernetes ポリシー、VPC 設定、DPU ソフトウェア、EVPN コントロールプレーン、物理ファブリックのいずれかに起因し得る。サポートチームは、あるテナントに別のテナントの情報を見せることなく、これらのレイヤーを横断する証拠を必要とする。公開ドキュメントは意図されたアーキテクチャを説明しているが、隔離障害や修復時間に関する独立したファブリック全体のデータセットは公開していない。

顧客向け管理面としてのベアメタル Kubernetes

CoreWeave Kubernetes Service は、ベアメタルインフラ上でマネージド Kubernetes を提供する。この設計は、コンテナプラットフォームと GPU サーバーの間に従来の仮想マシン向けの中間レイヤーを置くことを回避している。各クラスターには専用の VPC が割り当てられ、分散ワークロード向けに高性能ネットワークとストレージが統合される。

ベアメタルは抽象化レイヤーを一つ取り除くが、システムを単純にするわけではない。Kubernetes は GPU を認識し、デバイスをプロビジョニングし、クォータを実施し、Pod を配置し、ネットワークやストレージプラグインと連携しなければならない。プラットフォームは、ノードイメージ、ドライバ、ファームウェア、コンテナランタイム、クラスターアップグレードを基盤となるハードウェア世代と調和させる必要がある。顧客には使い慣れた API が提供されるが、CoreWeave は複雑な互換性マトリックスを引き受ける。

Kubernetes が決定できること、できないこと

Kubernetes は利用可能な情報とスケジューラーポリシーに基づいて、Pod をどこで実行するかを決定できる。しかし、すべてのレール、光モジュール、スイッチ経路、集団通信性能の条件を自動的に把握しているわけではない。CoreWeave は、論理的なスケジューリング決定が物理的に実行可能な割り当てと一致するように、デバイスプラグイン、オペレーター、トポロジー情報、運用制御を補完する必要がある。

ネットワークポリシーにも限界がある。Kubernetes ポリシーはワークロード間の許可トラフィックを制限できるが、VPC や DPU による制御の方がより包括的なテナント境界や経路制御を提供する。ポリシーオブジェクトがあるからといって、パケット経路が意図されたルールを実際に実施していることの証明にはならない。設定、実装、可観測性が一致していなければならない。

SUNK はクラスターを管理型スーパーコンピューターに変える

SUNK は、本番環境に対応した管理型スーパーコンピューターとして提供される。このサービスは、大規模な専有環境を求める顧客に対し、設備や運用チームを一から構築することなく、インフラ、高性能ファブリック、ワークロードオーケストレーション、CoreWeave の運用を統合する。

このサービスは責任分担を変える。顧客はモデルアーキテクチャ、コード、データ、ジョブ戦略に責任を持ち続けるが、ハードウェアライフサイクル管理、クラスター認定、障害対応の多くが CoreWeave に移行する。その結果は、交換可能なインスタンスの一般的なプールではなく、クラウド契約とソフトウェアを通じて提供される管理型 HPC 施設に近いものとなる。

Mission Control は運用を製品の一部にする

Mission Control は、監視、保守、修復、ライフサイクルサポートを追加する。その重要性は大規模ジョブにおいて特に顕著になる。小規模なサーバープールで故障コンポーネントを交換する影響は限定的かもしれないが、緊密に同期された割り当てにおける弱いリンクの診断は、数千時間分のアクセラレーターが有効に使われるか無駄になるかを左右し得る。

CoreWeave のサービスドキュメントは、プロアクティブな監視と運用介入について説明している。これは意図されたモデルを裏付けるが、独立して確認された可用性や平均修復時間の公開分布を示すものではない。包括的な障害カタログが存在しないことは重要である。信頼性こそが、顧客が自前でクラスターを構築するのではなくプロバイダーに支払う主な理由の一つだからだ。

ストレージはネットワーク化された計算の一部である

トレーニングデータ、チェックポイント、モデルアーティファクトは、ワークロード全体を制限し得るストレージ経路を介して移動する。GPU 間帯域幅が例外的に優れたクラスターでも、入力が十分な速度で読み取られず、チェックポイントが時間通りに書き込まれず、状態が迅速に復元されなければ停止し得る。CoreWeave のプラットフォームにはオブジェクトストレージとファイルストレージが含まれており、高性能なデータ移動をサービスの一部として位置付けている。

チェックポイントトラフィックは特有の運用パターンを生み出す。多数のワーカーが調整された間隔で状態を保存しなければならない場合があり、それによって集団通信とは異なる時間特性を持つ負荷スパイクが発生する。ストレージトラフィックがトレーニングファブリックと物理リソースを共有する場合、隔離または正確なキャパシティ計画が必要となる。別個のネットワークを経由する場合でも、プラットフォームは両方の経路にわたって障害と復旧を調整しなければならない。

ストレージは可搬性にも影響する。モデルを CoreWeave に移行するには、他のクラウドやプライベート環境からの大規模なインバウンド転送が必要になる場合がある。外部への移動は、コスト、時間、契約上の摩擦を生じさせ得る。「Zero Egress Migration」は、CoreWeave が特定の移行コストをプラットフォーム内で軽減するための商業的メカニズムである。これは技術的保証でも、普遍的な無料エグレスでもなく、データ移動が運用コストを生じさせないことの証明にもならない。

したがって顧客は、エンドツーエンドの証拠に基づいてスタックを評価すべきである。アクセラレーターとファブリックのピーク性能値は有用だが、本番ワークロードにはデータ前処理、チェックポインティング、モデル登録、ロギング、復旧が含まれる。単一のレイヤーのみを分離したベンチマークは、ジョブ全体がどれだけ早く完了するかという経済的な問いに答えを与えない。

バックボーンはリージョンを接続するが、同期スーパーコンピューターにはならない

CoreWeave は、北米と欧州のデータセンターを地上および海底光ファイバーで接続し、直接ピアリングとプライベート接続を提供するキャリアグレードのバックボーンについて説明している。提出書類には、拠点と可用性に応じて10 Gbps、100 Gbps、400 Gbps の Direct Connect オプションが記載されている。

バックボーンは、ローカルなスケールアウトファブリックとは異なる役割を果たす。データセット、レプリカ、チェックポイント、制御トラフィック、推論トラフィックをリージョン間で移動させることができる。ユーザーや他のクラウドと接続し、復旧や分散を支援する。しかし長距離での伝播遅延は、遠隔拠点が密結合ジョブにとって単一の低レイテンシトレーニングファブリックとなることを妨げる。

プライベート接続はある種の不確実性を低減する

専用回線は公衆インターネットルーティングの変動の一部を回避し、より明確なキャパシティとサポート境界を生み出すことができる。しかし、完全にプライベートなエンドツーエンドの世界を構築するわけではない。顧客アクセスは、キャリア、クロスコネクト、データセンター事業者に依存する可能性がある。クラウドオンランプには独自の受け入れ設定プロセスが存在する。経路の多様性や物理的所有権は、すべての拠点で完全に開示されているわけではない。

したがって、CoreWeave を Tier 1キャリアと呼ぶべきではない。同社はバックボーンとピアリングを運用しているが、提示された証拠はグローバルなセトルメントフリーの到達性も、すべての光ファイバー経路の所有権も示していない。その利点は、世界中のキャリアエコシステムを代替することではなく、自社のコンピュート資産への統合されたアクセスにある。

リージョン設計が可用性の決定を生む

CoreWeave は2025年末時点で6カ国に施設を報告した。拠点数は、あらゆるアクセラレーター世代、ファブリック、サービス、プライベート接続速度がすべての国で利用可能であることを意味しない。電力、冷却、ネットワーク、ハードウェア、運用準備が同時に整うわけではないため、リージョンは段階的に稼働する。

顧客にとって地理はレイテンシ以上に影響を与える。データガバナンス、クラウド近接性、人材、電源、相関障害、どのパートナーがローカル経路を管理するかといった要素に関わる。CoreWeave にとっては、新しい国ごとにキャパシティに加えて、法務、エネルギー経済、サプライチェーンに関する追加の調整が必要となる。したがってネットワークの地理的拡大は、同一の箱の地図ではなく、運用モデルである。

信頼性が資本を利用可能な時間に変える

CoreWeave のハードウェアは、ジョブが進行中であれ待機中であれ、資金調達された状態が続く。したがって信頼性は財務上の変数となる。ファブリック障害、弱い GPU、ストレージの停滞、スケジューラーのエラーは、課金可能で利用可能な能力を低下させ得るが、その間も金利、リース料、電力コミットメントは発生し続ける。

完全な故障よりもストラグラーが重要

故障したノードは可視化される。ストラグラーは技術的には動作していても、あらゆる同期ポイントを遅延させる可能性がある。大規模ジョブでは、バイナリの健全性だけでなく性能劣化を検出するテレメトリーが必要である。スケジューラーと運用チームは、コンポーネントをドレインするか、交換するか、そのまま使用し続けるかを判断しなければならない。

公開文書には、ジョブの中止、テールレイテンシー、ストラグラー頻度の完全な分布は含まれていない。これは信頼性が低いことを証明するものではないが、独立した比較を制限する。顧客はアーキテクチャ図から外挿するのではなく、契約、ワークロードテスト、自前の運用経験に依拠しなければならない。

認定はシステムテストである

CoreWeave がクラスターをリリースする前に、サーバー、スイッチ、光学モジュール、ケーブル、ファームウェア、ドライバ、ストレージ、オーケストレーションを統合的に認定しなければならない。起動テストが成功するだけでは不十分である。重要なのは、完全なトポロジーが意図されたワークロードを持続的に支え、障害を乗り越え、新たな不整合を生じさせることなく修復可能かどうかである。

認定には時間的次元もある。特定のソフトウェアとファームウェアの組み合わせで機能する設計が、アップグレード後に異なる挙動を示す可能性がある。新しい NVIDIA 世代の迅速な導入は、CoreWeave がサポートしなければならない組み合わせの数を増やす一方、古い契約環境は稼働し続ける。運用の成熟とは、各拠点を独自の例外にすることなく、この重なりを管理することである。

資金調達はアーキテクチャの一層である

CoreWeave は2025年に51億ドルの売上高と12億ドルの純損失を報告した。年間で設備投資として103億ドルの現金支払いが行われた。年末時点の残存履行義務は607億ドルであった。同じ提出書類には、大規模な機器ファイナンス、負債、リース、インフラコミットメントが記載されている。

これらの数字は異なる事象を表している。売上高はサービス収益として計上された収入である。設備投資の現金支払いは投資キャッシュアウトフローであり、設置済み全フリートの評価額ではない。純損失は、成長がまだ連結利益を生み出していないことを示す。残存履行義務は、会計上将来の契約上のサービス提供を表すものであり、手元現金や既に提供されたサービスを意味しない。

2026年第1四半期は需要と資金調達コストの双方を示した

2026年3月31日までの四半期について、CoreWeave は20億7800万ドルの売上高、7億4000万ドルの純損失、5億3600万ドルの支払利息を報告した。さらに同社は独自の定義に基づき、994億ドルの受注残高を明らかにした。これらの結果は、力強い需要の可視性と同時期の大きな資金調達負担を示している。

受注残高は、年末の残存履行義務と直接互換性があるわけではない。定義と時点が異なる。いずれも将来の契約需要を示すが、その転換は CoreWeave が施設、電力、ハードウェア、ネットワークキャパシティを稼働させ、その後契約を履行することにかかっている。受注残高が説得力を持てば持つほど、それに伴う提供義務は大きくなる。

GPU 担保ファイナンスが資産と契約を結びつける

CoreWeave は、担保付きローン、機器ファイナンス、顧客支援ストラクチャーを活用して拡大資金を調達してきた。2026年6月、同社は85億ドルの融資枠を発表し、当該取引について「GPU 担保」「投資適格格付」と説明された。この枠組みは提供能力を拡大するが、売上高ではなく、すべての企業債務に対する投資適格格付を意味するものでもない。

アセットバックファイナンスは、負債をハードウェアと契約上のキャッシュフローに適合させることができるが、同時に担保、使用、資金使途に関する制約も生み出す。アクセラレーター、スイッチ、光学モジュールは、多くの従来型インフラ資産と比較して急速に劣化する。このモデルは、稼働率が高く、顧客契約が機器の経済的価値が最も高い期間よりも長く継続する場合に最も有効に機能する。

したがってネットワーク設計は信用力に影響を与える。より高い稼働率を実現するトポロジーは、資金調達された資産の生産的アウトプットを増大させる。拠点の遅延、慢性的なストラグラー問題、移行の失敗はそれを低下させる。CoreWeave のモデルにおいて、システムエンジニアリングとバランスシートエンジニアリングは別個の話ではない。

顧客集中もまたインフラ依存である

Microsoft は、CoreWeave の2025年の売上高の67%を占めた。大口アンカー顧客はキャパシティを正当化し、資金調達を支え、プロバイダーが機器を早期に調達する確信を与えることができる。しかし同じ集中は、顧客に交渉力を与え、稼働率を単一のビジネス関係に依存させる。

CoreWeave は、Meta や Anthropic を含む他の顧客関係を発表または報告している。2026年7月には Flow Traders が基盤モデルのトレーニングに同社を選定し、Leidos は防衛、国土安全保障、諜報分野での AI に関する協業を発表した。これらの記述は、情報源が示す範囲での契約、選定、協業を裏付けるものであり、集中が解消されたことや、発表されたすべてのキャパシティが既に提供されていることを証明するものではない。

テイク・オア・ペイ契約はリスクを移転するが除去はしない

複数年のテイク・オア・ペイ契約は、CoreWeave に需要の可視性を与え、資金調達を支援し得る。コミットされた支払いが短期的な消費量だけに依存しないため、稼働率リスクの一部をプロバイダーから顧客に移転する。しかし、建設、電力、供給、性能、信用、再交渉のリスクは残存する。

顧客にとって、その契約はクラウドの約束の一部を逆転させる。従来のパブリッククラウドは弾力的な消費と低いコミットメントを強調する。専有 AI クラスターは、プロバイダーが特定のキャパシティを構築または予約しているため、より長期的でインフラ寄りの関係を必要とし得る。表面的にはクラウドソフトウェアのように見えるサービスも、その下ではプロジェクトファイナンスのように振る舞う。

防衛・規制業務は証明のハードルを上げる

2026年7月30日の Leidos との協業は、プラットフォームを防衛・諜報ミッションの方向へ拡大する。こうした協業は、規制対象業務に必要なすべての認可、認証、調達が完了したことを証明するものではない。しかし、セキュリティ、サプライチェーン管理、監査可能性、事業継続性が CoreWeave 製品のより重要な構成要素になり得ることを示している。

DPU により実施される VPC、プライベート接続、管理された運用は、高い保証レベルの設計を支援できるが、プログラム固有の管理、人員要件、データ処理規則、政府セキュリティクリアランスを代替するものではない。CoreWeave がミッションクリティカルなワークロードに接近するほど、その責任境界はより透明でなければならない。

買収はスタックを上方に動かし、頓挫した合併は下方を指し示した

2025年、CoreWeave は Weights & Biases、OpenPipe、marimo、Monolith AI を買収した。Weights & Biases はモデル開発と可観測性のツールを追加し、その他の買収は推論、ノートブック、産業用 AI の機能を拡張した。これにより CoreWeave は、純粋なインフラストラクチャを超えて、開発ライフサイクルのより多くの部分へと進出している。

戦略的論理は明らかだ。モデルワークフローを理解するプロバイダーは、需要をより的確に予測し、インフラを利用しやすくし、より多くの開発フェーズにわたって顧客を囲い込むことができる。しかし統合リスクも同様に明らかである。ソフトウェア企業は、資金調達を受けたデータセンター事業者とは異なるリリースサイクル、利益率、企業文化を持つ。CoreWeave が、これまで顧客が独立系ベンダーから調達していたツールを所有しようとすれば、製品の重複やパートナーとの衝突が生じ得る。

Core Scientific の買収計画は逆方向を示した。CoreWeave は2025年7月に、データセンターキャパシティとリース経済性に対するより大きな支配をもたらす合併契約を発表した。しかし Core Scientific は、株主投票の後、2025年10月30日にこの契約を終了した。CoreWeave は同社を買収していない。

これらを総合すると、トランザクションは二方向の統合戦略を示している。上方へは開発者ソフトウェア、下方へは物理的なキャパシティへと向かう。同時に、頓挫した合併は、インフラの支配権が常にプラットフォームのスケジュール通りに購入できるわけではないことを示している。株主、規制当局、資金調達、契約構造が、垂直統合の技術的論理を阻止し得るのだ。

CoreWeave が支配するものと、その境界の外にあるもの

CoreWeave は、顧客向けプラットフォーム、多数の設計決定、機器認定、オーケストレーション、運用プロセスを支配している。Nimbus がどのように VPC をマッピングするか、クラスターをどのように提示するか、どのサービスがマネージドか、障害にどのように対応するかを決定できる。ハードウェアを早期に調達し、施設をアクセラレーター密度に合わせて設計することも可能だ。

NVIDIA は、GPU、NVLink、InfiniBand、Spectrum-X、BlueField に関する重要な製品ロードマップを支配している。電力会社やデータセンターパートナーは、電力および建物の提供の一部を支配する。光ファイバーキャリア、IX、クラウドプロバイダーは外部接続の一部を支配する。貸し手や機器ファイナンス提供者は資本投下を制限する。大口顧客は契約を通じてキャパシティ計画に影響を与える。

これは CoreWeave 特有の欠陥ではない。あらゆるクラウドはサプライヤーと施設に依存している。しかし、CoreWeave の差別化は NVIDIA システムの迅速な導入と密接に結びついており、運用実績に対して資本コミットメントが異例に大きいため、この集中は重要である。サプライヤーの遅延やロードマップ変更は、顧客への提供と資金調達に波及し得る。

プラットフォームの強みは、これらの境界を越えた調整にある。そのリスクは相関する依存関係である。同じサプライヤー世代、同じ拠点設計、同じ顧客プログラムが、複数のレイヤーに同時に影響を及ぼし得る。統合は顧客が管理すべき契約数を減らすが、プロバイダーの障害がもたらす結果を増幅させる可能性がある。

競争ポジション:特化型クラウドは責任の所在を決める選択である

CoreWeave は、ハイパースケーラークラウド、他の特化型 GPU クラウド、顧客所有クラスター、コロケーション、ホスティング、マネージドインテグレーションの組み合わせと競合している。比較は GPU 数や単一のベンチマークに還元できるものではない。購入者は、利用可能なハードウェア世代、ファブリック、ストレージ、スケジューリング、プライベート接続、サポート、契約期間、地理、データ移動の総コストを比較する。

ハイパースケーラークラウドとの比較

AWS、Microsoft Azure、Google Cloud、Oracle は、幅広いサービスポートフォリオ、グローバルなエコシステム、大きなバランスシートを提供する。AI インフラをデータベース、セキュリティ、分析、既存のエンタープライズ調達と結びつけることができる。CoreWeave の対抗軸は特化である。特定の NVIDIA 世代のより迅速な統合、ベアメタルオーケストレーション、高密度アクセラレーターワークロードに特化したプラットフォームだ。

特化は抽象化を減らし、認定を短縮できる一方で、より狭い障害ドメインとサプライヤープロファイルを生み出す可能性もある。CoreWeave を選択する顧客は、ワークロードに集中したプロバイダーを得るかもしれないが、サービス範囲の狭さと若い資本構造を受け入れることになる。正しい比較はカテゴリー論ではなく、ワークロード固有のものである。

他の特化型クラウドとの比較

Lambda、Nebius、Crusoe、その他の AI インフラプロバイダーは、アクセラレーター提供、クラスター、マネージドサービスにおいて重複している。地理、エネルギー戦略、ソフトウェアポートフォリオ、所有構造、資本モデル、施設管理の度合いなどで差異がある。「Neocloud」は市場用語であり、共通のアーキテクチャを指すものではない。

CoreWeave の公開提出書類は、規模とリスクに関して異例に詳細な証拠を提供している。それ自体は、優れたテクノロジーや優れた経済性を証明するものではない。開示が少ない競合他社は、より小規模で、より効率的か、単に不透明なだけかもしれない。分析は透明性を性能ランキングに変換してはならない。

プライベートクラスターの構築との比較

顧客所有のクラスターは、ハードウェア、データ、運用に対する直接的な管理を購入者に与える。同時に、調達、電力、建物、ネットワーク、ストレージ、セキュリティ、ファームウェア、予備部品、専門人材を要求する。CoreWeave は、この負荷の大部分を移管することを販売している。

移管は不完全である。顧客は引き続きワークロードを設計し、データを管理し、ポリシーを設定し、プロバイダーリスクを評価する。長期コミットメントはスイッチングの選択肢を制限し得る。プライベートクラスターでは稼働率低下のリスクを顧客が負い、クラウド契約ではプロバイダー依存のリスクを負う。経済的には、どちらの当事者が変動をよりよく吸収し、高価なシステムを生産的に維持できるかが問題となる。

液冷スイッチングは、次のボトルネックがどこに移動し得るかを示している

2026年7月、CoreWeave は、ラックあたりのネットワーク帯域幅密度を高める液冷スイッチングに関する資料を公開した。この主張は企業アーキテクチャと独自計算に基づくものであり、独立したフリート全体のベンチマークに基づくものではない。しかし、このメカニズムは重要である。アクセラレーター密度が高まるにつれ、スイッチと光学モジュールが消費する電力と発熱が、ラックレベルの冷却問題の一部となるからだ。

スイッチの液冷化は、限られたラックスペース内でより多くのネットワークキャパシティを可能にし、スイッチングファブリックを離れた場所に配置する必要性を減らすことができる。経路が短くなれば、ケーブル配線が簡素化され、密度が維持される。しかし、この設計はネットワークメンテナンスを液冷システムと結合させる。漏れ、ポンプの問題、メンテナンス手順が、以前は空冷のネットワーク機器として扱われていたコンポーネントに影響を及ぼす可能性がある。

この変化はより一般的なパターンを示している。AI インフラのボトルネックは移動するのだ。より高速な GPU はより多くのスケールアップ帯域幅を必要とし、ラック帯域幅の増加はより高密度なスケールアウトスイッチングを要求し、高密度スイッチングは電力と冷却の要求を高める。新たな施設は、それに応じて異なる機械的・電気的設計を必要とする。したがって、一世代の製品は単なるサーバーアップグレードではなく、データセンターの改修を要求し得るのである。

Vera Rubin は将来の移行であり、既存フリートの説明ではない

CoreWeave の2026年7月の資料は、NVIDIA Vera Rubin NVL72 への準備について説明し、Blackwell と比較した1メガワットあたりのトークン数に関する同社の測定値または将来予測に関する記述を含んでいる。これらの情報は CoreWeave と指定された構成に帰属すべきであり、調査時点においてフリート全体での利用可能性を証明するものではない。

新世代は、アクセラレーター、スケールアップファブリック、スケールアウト帯域幅、ラック電力、冷却、ファームウェア、ドライバ、オーケストレーション、認定といった複数のレイヤーを同時に変化させる。メガワットあたりの出力を向上させる一方で、既存施設を不適切または競争力の低いものにする可能性もある。CoreWeave が新しいハードウェアを迅速に導入できる能力は、古い契約資産の移行、稼働率維持、減価償却を管理できる場合にのみ戦略的強みとなる。

この移行は NVIDIA への依存も深める。早期アクセスは顧客を引き付け、プレミアム契約を支えることができるが、同時に、自社では制御できない供給時期、価格、アーキテクチャ決定に企業をさらすことにもなる。顧客やソフトウェアレベルでの多角化は、必ずしも物理スタックの多角化にはつながらない。

スタックがデジタルインフラに与えるより広範な影響

CoreWeave の拡大は、GPU レンタルをはるかに超えて市場に影響を及ぼす。ギガワット級のコミットメントは、発電、送電網接続、変圧器、冷却、用地、建設工事に対する需要を生み出す。高ポート密度のファブリックはスイッチ、光学モジュール、光ファイバーを必要とする。プライベート接続は、キャリアキャパシティ、IX プレゼンス、クラウドオンランプの需要を喚起する。資金調達構造は、急速に旧式化するテクノロジーを長期契約と照らして評価できる貸し手を必要とする。

このプラットフォームは、インターネットトラフィックの可視化される場所も変える。密結合のトレーニング通信は主にローカルファブリック内にとどまるが、データセット、チェックポイント、モデルアーティファクト、推論リクエスト、開発者ワークフローは、クラウド間、データセンター間、ユーザー間を移動する。したがって、インターネットに対する可視的な影響は、単一の巨大なトレーニングストリームからではなく、トレーニング環境を取り巻く継続的なデータ移動から生じる可能性が高い。

施設を受け入れるコミュニティや電力網にとって、このスタックは電力と土地利用に関する決定である。本調査パッケージには、企業全体の環境判断を下すのに十分な拠点固有の証拠は含まれていない。しかし、稼働電力と契約済み電力が重要な成長指標であり、電力や建物の提供の遅延がビジネスリスクであることを示している。

ネットワークエンジニアにとって、このアーキテクチャは AI インフラが独自の専門領域になりつつあることを示している。ルーティングやスイッチングの知識は依然として必要だが、今やそれらは集団通信ライブラリ、アクセラレータートポロジー、液冷、ワークロードスケジューリング、プロジェクトファイナンスと交差する。輻輳制御を調整する者は、ジョブの完了と債務返済を同時に守っている可能性がある。

公開証拠が示せないこと

CoreWeave は製品ドキュメント、技術ブログ、財務報告を公開しているが、スタックの一部は不透明なままである。提供された資料には、完全な最新トポロジー、拠点固有のファブリック一覧、オーバーサブスクリプション表、光ファイバー所有権マップ、包括的な障害履歴、個別ワークロードの独立したベンチマークアーカイブは含まれていない。

この限界は、主張の表現を規定しなければならない。アーキテクチャドキュメントはメカニズムを証明できる。SEC 提出書類は連結財務およびリスクの事実を証明できる。名前付きの顧客コミュニケーションは選定や協業を証明できる。しかし、これらの情報源のいずれも、普遍的なワークロード結果、フリート全体の可用性、すべての購入者にとっての総コスト削減を証明するものではない。

同様の注意は規模についても当てはまる。稼働電力は契約済み電力と同一ではない。受注残高は売上高ではない。予定された将来の決算説明会はまだ結果ではない。発表された顧客契約は実際の利用とは異なる。計画された買収は所有権を意味しない。将来のハードウェア世代は現在のフリートではない。

これらの区別はプロファイルを弱めるものではない。専門家の読者が対処しなければならない真の情報ギャップを特定しているのである。CoreWeave は、最も価値のある詳細が必然的に非公開となる統合システムを、顧客と資本提供者に信頼するよう求めている。合理的な対応は、卓越性や失敗を推測することではない。個々の契約、クラスター、拠点レベルでの証拠を要求することである。

中心的な判断

CoreWeave の製品はしばしば計算能力と形容されるが、より本質的な製品は調整である。同社は、サプライヤーのロードマップとデータセンター建設、スケールアップリンクとスケールアウトファブリック、DPU ポリシーとテナントの意図、Kubernetes スケジューリングと物理トポロジー、ストレージとチェックポイントの挙動、バックボーン接続と顧客アクセス、長期資金調達と短期のハードウェア世代を調整しなければならない。

この調整は真の優位性を生み出し得る。特化型プロバイダーは、顧客に個別のベンダーを組み合わせさせる代わりに、ワークロード全体にわたる決定を下せる。システムを認定し、障害を修正し、多くの企業が単独で行うよりも迅速に新世代を導入できる。プラットフォームの急速な成長は、大口顧客がこの責任移管を評価していることを示唆している。

しかし、同じ統合は結果を集中させる。ファブリック設計、供給遅延、ポリシーの誤り、資金調達の制約、アンカー顧客の変化が、システムの大部分に影響を及ぼし得る。同社の将来は、見出しの帯域幅数値にかかっているのではない。資金調達されたキャパシティを、すべてのレイヤーが継続的に信頼できる顧客の成果へと変換できるかどうかにかかっている。