Résumé
- La pile réseau de CoreWeave couvre la montée en puissance verticale, horizontale, le stockage, les locataires, la gestion, le backbone et la connexion privée; il s’agit d’une architecture opérationnelle, pas d’un produit séparé.
- Les réseaux et DPU de NVIDIA se combinent avec le logiciel de CoreWeave pour programmer des accélérateurs, isoler les locataires et déplacer les données à travers un cloud spécialisé.
- CoreWeave a déclaré 43 centres de données, plus de 850 MW actifs et environ 3,1 GW sous contrat; Microsoft a contribué à 67 % des revenus de 2025, illustrant l’échelle et la concentration.
- L’épreuve consiste à convertir la puissance sous contrat et le portefeuille en un service fiable et diversifié avant que le financement, les baux, l’obsolescence et la complexité opérationnelle ne s’accumulent.
L’empreinte physique a crû plus vite que ne le suggère une carte de régions classique
Au 31 décembre 2025, CoreWeave a déclaré 43 centres de données, plus de 850 MW actifs et environ 3,1 GW sous contrat. Le chiffre actif décrit l’infrastructure opérationnelle selon sa définition à cette date; le chiffre sous contrat, des droits et engagements futurs. Il ne s’agit pas de capacité déjà installée.
La progression a été marquée: 10 centres et environ 70 MW fin 2023; 32 et plus de 360 MW fin 2024; 43 et plus de 850 MW fin 2025. Au premier trimestre 2026, plus de 1 GW actif et plus de 3,5 GW sous contrat. Les chiffres montrent une industrialisation à grande vitesse et aussi comment l’architecture d’hier peut rapidement devenir minoritaire.
La puissance est une condition préalable, pas un produit fini. Un mégawatt sous contrat nécessite encore l’interconnexion, la production ou le réseau, une distribution électrique dense, le refroidissement, le bâtiment, le réseau, la livraison des accélérateurs et l’acceptation opérationnelle. Un retard dans une couche quelconque peut reporter des revenus tandis que certaines obligations commencent avant.
Le modèle de centres de données est mixte. CoreWeave possède des équipements et contrôle des déploiements importants, mais utilise des installations louées et des tiers. Cela accélère l’expansion et évite de construire chaque bâtiment, mais fait que la performance du bailleur, la construction, la puissance et les conditions contractuelles font partie de la fiabilité.
Un GPU seul ne fait pas encore un cloud
Un accélérateur installé dans un rack et alimenté peut exécuter du code, mais à lui seul il n’offre pas ce qu’un client achète à un cloud. Un cluster d’entraînement nécessite que de nombreux accélérateurs se comportent comme une allocation unique. Les données doivent arriver du stockage au rythme approprié. Les opérations collectives doivent traverser les GPU sans que le travail passe la plupart du temps à attendre la communication. Les locataires doivent rester isolés. Les planificateurs doivent savoir quels nœuds, liens et périphériques sont sains. Les points de contrôle doivent survivre aux pannes.
Les ingénieurs ont besoin d’un chemin vers l’environnement et les utilisateurs d’un autre vers les clouds, les bureaux et les services externes. Le produit cloud commence lorsque ces chemins deviennent reproductibles.
C’est pourquoi le réseau d’un cloud IA ne peut pas être traité comme un accessoire du calcul. Dans l’architecture d’entreprise classique, on décrit souvent le réseau comme le système qui connecte des serveurs. En IA distribuée, il participe directement au calcul effectif. Un travail synchrone peut être limité par une seule optique dégradée, un accélérateur lent, un rail congestionné ou un chemin de stockage incapable de suivre le rythme. Le matériel inactif continue de coûter pendant que le travail attend. Le réseau affecte ainsi non seulement les benchmarks, mais l’économie de chaque heure de GPU financée.
La plateforme de CoreWeave constitue un bon objet d’étude parce qu’elle rend cette relation visible. L’entreprise se spécialise dans l’infrastructure d’accélérateurs, au lieu de proposer les GPU comme un service mineur au sein d’un cloud généraliste. Ses documents publics décrivent les fabrics de rack, les unités de traitement de données, l’orchestration bare-metal, les supercalculateurs gérés, la connectivité privée et la réparation opérationnelle avec plus de détails qu’un simple catalogue d’instances.
Ces documents attestent de l’intention de conception et de l’architecture du produit; ils ne forment pas une carte complète de chaque installation, génération ou déploiement client.
La question n’est pas de savoir si CoreWeave dispose « d’un réseau rapide » dans l’abstrait. La question utile est de savoir combien de réseaux différents doivent coopérer avant qu’une charge d’IA puisse fonctionner comme un service fiable, et qui contrôle chacun d’eux.
Ce que signifie réellement « pile réseau de CoreWeave »
L’expression est un terme générique éditorial, pas une entité juridique ni un SKU vendu séparément. L’opérateur légal et économique est CoreWeave, Inc., une société du Delaware dont le siège est à Livingston, New Jersey, cotée au Nasdaq sous le symbole CRWV. La pile réseau fait partie de CoreWeave Cloud Platform, qui comprend aussi le calcul, le stockage, l’orchestration et les services gérés.
Différents noms décrivent des couches distinctes. Nimbus est l’architecture de réseau virtuel basée sur les DPU de CoreWeave. CoreWeave Kubernetes Service, ou CKS, fournit Kubernetes géré sur bare metal. SUNK empaquette l’infrastructure et les opérations en un service de supercalculateur géré. Mission Control ajoute la supervision, la réparation et la gestion du cycle de vie. Direct Connect apporte une connectivité privée pour les clients. NVLink, NVSwitch, Quantum, Spectrum-X et BlueField sont des technologies NVIDIA intégrées par CoreWeave, pas des inventions propres à l’entreprise.
Séparer ces couches évite deux erreurs courantes. La première consiste à attribuer à l’entreprise chaque protocole ou périphérique de la plateforme. La contribution de CoreWeave est l’intégration des systèmes, la qualification, l’exploitation et le logiciel cloud autour de la technologie des fournisseurs. La seconde est d’imaginer un fabric uniforme qui s’étend de chaque GPU à chaque client. Les liaisons locales scale-up, les fabrics d’entraînement inter-rack, les réseaux de stockage, les overlays VPC, les chemins de gestion et le backbone transatlantique ont des objectifs, des budgets de latence et des domaines de défaillance différents.
Ils ne peuvent pas se résumer à un seul chiffre de bande passante.
La même rigueur s’applique à la propriété. CoreWeave déploie et exploite des équipements substantiels, mais ses documents décrivent aussi des baux, des centres de données tiers, des engagements de puissance, des relations avec des fournisseurs de fibre et le financement d’équipements. Un service peut être intégré opérationnellement sans que l’entreprise soit propriétaire du bâtiment, de la compagnie d’électricité, de la liaison longue distance ou de chaque composant du rack. L’« intégration verticale » n’est utile que si elle signifie un contrôle coordonné de nombreuses couches, pas une autosuffisance totale.
D’Atlantic Crypto au calcul spécialisé
CoreWeave a été fondée en 2017 sous le nom de The Atlantic Crypto Corporation. Son activité initiale utilisait des GPU pour des charges de crypto-monnaie, et en septembre 2018, elle est passée du statut de LLC à celui de société du Delaware. Elle a adopté le nom CoreWeave en décembre 2019 en s’orientant vers le calcul cloud spécialisé.
L’origine se résume parfois à un contraste frappant entre le minage de crypto-monnaies et l’intelligence artificielle. La continuité la plus importante est opérationnelle. Les deux activités exigent d’acheter des accélérateurs, de sécuriser l’électricité, de maintenir un matériel dense et de diriger les charges vers une capacité sous-utilisée. L’entreprise a appris l’économie d’une flotte d’accélérateurs avant de construire les systèmes de location, réseau, stockage et support d’un cloud.
La distinction importe car un changement de demande ne crée pas automatiquement une plateforme. Les charges de minage peuvent être relativement répétitives et tolérer un modèle d’actifs simple. Les effets visuels, l’apprentissage automatique et le calcul haute performance exigent des logiciels, des mouvements de données, une isolation et des garanties de service différents. CoreWeave a dû ajouter les couches qui permettent aux clients externes de faire confiance à des ressources qu’ils ne possèdent pas et ne peuvent pas inspecter physiquement.
Au cours des premières années de la décennie 2020, l’entreprise a développé des services spécialisés de calcul, de stockage et Kubernetes. Kubernetes sur bare metal est devenu une interface principale: les clients pouvaient planifier des charges conteneurisées directement sur des serveurs avec accélérateurs sans passer d’abord par une couche conventionnelle de machines virtuelles. Fin 2023, CoreWeave exploitait 10 centres de données et environ 70 MW actifs. Fin 2024, elle déclarait 32 centres et plus de 360 MW.
L’expansion a changé la nature du problème réseau. Un opérateur avec dix installations peut beaucoup dépendre de la connaissance experte et des exceptions locales. Un cloud de trente ou quarante nécessite des conceptions reproductibles, des politiques contrôlées par logiciel, une qualification commune, une supervision partagée et un moyen de déplacer les clients entre les générations de matériel sans perdre la cohérence opérationnelle.
L’échelle transforme les bonnes décisions d’ingénierie en questions de gouvernance: qui approuve les changements, à quelle vitesse les exceptions sont-elles détectées, et chaque nouvelle installation reproduit-elle les limites de contrôle prévues?
CoreWeave a finalisé son introduction en bourse en mars 2025. La cotation n’a pas seulement apporté du capital. Elle a aussi produit un prospectus et des documents de la SEC avec des preuves sur les installations, la concentration de la clientèle, la dette, les baux, l’architecture d’interconnexion et le risque. Cet enregistrement permet d’étudier la pile réseau comme un système technique et, en même temps, comme l’engagement d’une société cotée.
La charge de travail qui détermine l’architecture
L’entraînement de grands modèles répartit le calcul entre les accélérateurs et échange à plusieurs reprises des résultats partiels. Le motif exact dépend de l’architecture du modèle, de la méthode de parallélisation et du logiciel, mais le problème d’infrastructure est stable: la vitesse utile de l’allocation dépend de la communication collective autant que du calcul local. Un fabric qui semble rapide en termes agrégés peut gaspiller de la capacité si la congestion, la topologie ou la latence de queue ralentissent les points de synchronisation qui maintiennent le travail ensemble.
La pile doit également traiter un trafic qui ne se comporte pas comme une collective. Les jeux de données entrent dans l’environnement. Les points de contrôle sortent de la mémoire du GPU et arrivent dans le stockage. Les systèmes de contrôle distribuent les travaux et les politiques. Les ingénieurs récupèrent les logs. Les services exposent des points de terminaison d’inférence. Les copies et les répliques peuvent traverser les régions. Chaque classe possède une tolérance différente au retard et à la perte. Traiter le tout comme un seul réseau indifférencié rendrait difficile de prédire les performances et d’isoler les pannes.
Le résultat est une conception en couches. Les liaisons scale-up créent un domaine étroitement couplé à l’intérieur d’un système à l’échelle du rack. Les fabrics scale-out relient de nombreux systèmes entre les racks. Les chemins de stockage alimentent et préservent la charge. Un réseau de locataire fournit des adresses privées et des politiques. Un réseau de gestion donne à l’opérateur le contrôle des hôtes, des DPU, des commutateurs et des réparations. Un backbone relie les installations et les écosystèmes externes. Les circuits privés du client relient le cloud à d’autres domaines administratifs.
Les couches interagissent, mais ne sont pas interchangeables. La fibre longue distance ne remplace pas un fabric GPU local, car le temps de propagation rend difficile l’entraînement hautement synchrone entre des centres distants. Un domaine NVLink n’est pas un VPC client. Un overlay peut masquer des différences d’adressage, mais ne répare pas une optique cassée dans l’underlay. Kubernetes peut planifier un pod sans comprendre chaque rail, sauf si la plateforme lui fournit des informations topologiques et des intégrations de périphériques.
L’architecture est donc une chaîne de traduction de l’intention. Le client demande un cluster, un namespace, un réseau ou un travail. Les systèmes de contrôle de CoreWeave transforment la demande en serveurs, fabric, stockage et politiques disponibles. Nimbus traduit l’intention du VPC en état du DPU et de l’underlay. Kubernetes et les services liés à Slurm transforment l’intention de travail en nœuds et accélérateurs. Mission Control convertit les signaux de santé en actions de réparation. Le client voit un service; la plateforme doit maintenir toutes les traductions cohérentes.
Réseau scale-up à l’intérieur du domaine rack-scale
Le réseau scale-up connecte les accélérateurs à l’intérieur d’un système étroitement intégré. Dans les conceptions rack-scale de NVIDIA, NVLink offre une communication à large bande passante entre GPU et NVSwitch fournit la commutation à l’intérieur de ce domaine local. CoreWeave intègre les deux technologies dans des systèmes et générations sélectionnés.
La caractéristique clé n’est pas la marque, mais la proximité. Un domaine scale-up permet à des partitions du modèle et à des opérations collectives d’échanger des données sans traverser le réseau ordinaire du centre de données à chaque étape. Ainsi, un rack peut se comporter davantage comme un grand système accélérateur que comme un ensemble de serveurs indépendants. Il crée également son propre domaine de panne: un commutateur, un câble, un problème de refroidissement ou un composant défectueux à l’intérieur du rack peut affecter de nombreux GPU que le planificateur s’attendait à utiliser ensemble.
Le prospectus de CoreWeave décrivait des configurations sélectionnées avec une bande passante d’interconnexion GPU non bloquante allant jusqu’à 3 200 gigabits par seconde. L’expression « configurations sélectionnées » est la partie décisive. Elle n’établit pas un niveau de service universel ni ne décrit tous les centres ou générations. La bande passante effective pour une charge dépend également du logiciel, de la topologie, du motif de messages et de l’état complet du chemin.
Le scale-up réduit un goulot d’étranglement tout en augmentant la densité dans d’autres couches. Plus d’accélérateurs et plus de bande passante locale augmentent la puissance, le refroidissement et les exigences de service du rack. Un système qui concentre le calcul sans une conception thermique et opérationnelle équivalente peut être plus difficile à réparer ou à voir sa limitation déplacée vers le scale-out et le stockage. L’architecture doit se lire comme un équilibre, pas comme une succession de spécifications maximales.
Fabrics scale-out: InfiniBand et Ethernet coexistent
Lorsqu’un travail sort du domaine scale-up, il entre dans le fabric scale-out. Les documents de CoreWeave décrivent NVIDIA Quantum-2 InfiniBand, Quantum-X800 XDR de 800 gigabits et Spectrum-X Ethernet avec RoCE et RDMA. La présence à la fois d’InfiniBand et d’Ethernet est significative: la plateforme ne réduit pas son identité à une seule famille de protocoles.
InfiniBand pour les clusters étroitement couplés
InfiniBand est conçu pour une communication à faible latence orientée vers l’accès direct à la mémoire à distance et a une longue histoire dans le HPC. Dans un cluster IA, il peut déplacer des données entre des hôtes d’accélérateurs en évitant une partie du traitement normal du CPU. Les systèmes Quantum de NVIDIA ajoutent de la commutation et des capacités orientées vers les opérations collectives. CoreWeave intègre ces fabrics dans les offres de cluster, et ne vend pas InfiniBand comme un service de transporteur séparé.
Les preuves publiques ne révèlent pas toutes les topologies, les ratios de sursouscription, les politiques de routage ou les limites de service. « Non bloquant » peut décrire une conception spécifique, pas l’ensemble de la flotte. Même un fabric bien conçu peut souffrir d’optiques dégradées, de mauvaise localisation, de trafic déséquilibré ou de logiciels qui génèrent des points chauds. Les acheteurs doivent demander quelle génération, quelle topologie et quel processus de qualification correspondent au cluster qu’ils reçoivent.
Spectrum-X et RoCE comme chemin Ethernet
Spectrum-X est la plateforme réseau Ethernet de NVIDIA pour l’IA. RoCE transporte la sémantique RDMA sur Ethernet, de sorte que les applications utilisent l’accès direct à la mémoire tandis que l’opérateur conserve un fabric Ethernet. L’utilisation de Spectrum-X offre à CoreWeave une voie scale-out alternative pour les charges et les générations conçues dans cet écosystème.
La familiarité d’Ethernet ne signifie pas une exploitation simple. Les performances de RoCE dépendent du contrôle de la congestion, de la conception des files d’attente, du comportement en cas de perte, de la télémétrie et de la configuration de bout en bout. Un réseau peut employer des trames Ethernet connues et nécessiter une ingénierie spécialisée pour éviter le blocage de tête de ligne, l’incast ou l’instabilité dans les collectives. Un cloud intégré assume une grande partie de ce réglage, mais le client perd la visibilité directe sur les décisions.
Topologie optimisée par rails et placement
Les systèmes multirail regroupent les NIC et les accélérateurs correspondants pour que le trafic collectif emprunte des chemins parallèles prévisibles. Une conception optimisée par rails peut réduire les croisements inutiles et régulariser la bande passante. Elle exige également que le planificateur comprenne la topologie: répartir le travail sur la mauvaise combinaison de nœuds peut annuler la conception physique.
Les rails peuvent concentrer les pannes. Si l’un d’eux se dégrade, chaque nœud qui utilise ce chemin peut devenir un retardataire même si les autres interfaces restent saines. Le système opérationnel doit distinguer un serveur défaillant d’un problème réseau partagé. C’est pourquoi la télémétrie topologique, la qualification et la réparation importent autant que la vitesse nominale du port.
Nimbus déplace la limite du cloud vers la DPU
Un fabric haute performance ne crée pas à lui seul un cloud multilocataire. Les clients ont besoin d’adresses privées, de contrôle de routage, d’accès à Internet et d’isolation. CoreWeave répond avec Nimbus, une architecture de réseau virtuel qui décharge les fonctions VPC sur des unités de traitement de données. La documentation identifie des DPU NVIDIA BlueField-3 et décrit les VRF, VXLAN et les routes EVPN Type 5.
La DPU occupe une position privilégiée entre le calcul contrôlé par le client et l’infrastructure contrôlée par le fournisseur. Elle peut traiter du trafic virtuel, appliquer une segmentation et réserver des ressources CPU pour la charge. Elle peut également maintenir une frontière de location en dehors du système d’exploitation contrôlé par le client. La séparation est une décision de performance et de sécurité.
Comment l’overlay VPC est construit
Une instance VRF sépare un domaine de routage d’un autre. VXLAN transporte les segments de locataires sur un underlay physique partagé. EVPN distribue l’accessibilité et les routes Type 5 peuvent annoncer des préfixes IP, pas seulement des adresses MAC. Ensemble, ces mécanismes permettent à CoreWeave de présenter un réseau privé sur une infrastructure commune.
L’overlay n’élimine pas la dépendance à l’underlay. Si la connectivité physique échoue, le réseau virtuel échoue aussi. Si la distribution des routes est incorrecte, l’isolation ou l’accessibilité peuvent se briser à grande échelle. Si une image DPU ou le système de politiques contient une erreur, de nombreux hôtes peuvent rapidement recevoir le même état erroné. L’abstraction réduit la complexité pour le client en la transférant au fournisseur; elle ne l’efface pas.
La DPU entre dans la base de confiance
Nimbus réduit l’exposition des fonctions réseau du fournisseur à l’hôte du client, mais augmente l’importance du firmware, du démarrage sécurisé, des clés, de la distribution des politiques, des logs et de la récupération de la DPU. Un dispositif qui impose l’isolation doit être observable et actualisable sans devenir un chemin incontrôlé vers l’environnement du locataire.
La frontière de contrôle affecte également la réponse aux incidents. Une panne de connectivité peut avoir pour origine la charge, une politique Kubernetes, la configuration VPC, le logiciel DPU, le contrôle EVPN ou le fabric physique. Les équipes de support ont besoin de preuves qui traversent les couches sans révéler un locataire à un autre. La documentation explique l’architecture prévue, mais ne publie pas d’historique indépendant des pannes d’isolation ou des temps de réparation de l’ensemble de la flotte.
Kubernetes bare metal comme surface de contrôle client
CoreWeave Kubernetes Service fournit Kubernetes géré sur une infrastructure bare metal. La conception évite une couche conventionnelle basée d’abord sur les machines virtuelles entre les conteneurs et les serveurs GPU. Chaque cluster reçoit son propre VPC et intègre des réseaux haute performance et du stockage pour les charges distribuées.
Le bare metal élimine une couche, mais ne simplifie pas complètement le système. Kubernetes doit découvrir les GPU, exposer les périphériques, appliquer des quotas, placer les pods et interagir avec les plugins réseau et stockage. La plateforme coordonne les images, les pilotes, le firmware, le runtime de conteneurs et les mises à jour du cluster avec la génération du matériel. Le client obtient une API connue et CoreWeave hérite d’une matrice de compatibilité exigeante.
Ce que Kubernetes peut décider et ce qu’il ne peut pas
Kubernetes peut décider où exécuter un pod conformément aux informations et aux politiques dont dispose le planificateur. Il ne comprend pas automatiquement chaque rail, optique, chemin de commutation ou condition collective. CoreWeave doit ajouter des plugins, des opérateurs, des informations topologiques et des contrôles pour qu’une décision logique corresponde à une allocation physique viable.
La politique réseau est également délimitée. Les politiques Kubernetes restreignent le trafic entre les charges, tandis que le VPC et la DPU offrent des frontières plus larges de location et de routage. Un objet de politique ne démontre pas que le paquet emprunte un chemin qui applique l’intention. La configuration, la mise en œuvre et l’observation doivent coïncider.
SUNK transforme le cluster en supercalculateur géré
SUNK se positionne comme un service de supercalculateur géré pour la production. Il combine l’infrastructure, le fabric haute performance, l’orchestration des charges et les opérations de CoreWeave pour les clients qui souhaitent un grand environnement dédié sans construire d’installations et d’équipes opérationnelles complètes.
Le service modifie la répartition des responsabilités. Le client conserve l’architecture du modèle, le code, les données et la stratégie de travail; CoreWeave assume davantage le cycle de vie du matériel, la qualification et les incidents. Le résultat ressemble à une installation HPC gérée livrée par des contrats et des logiciels cloud, pas à une réservation d’instances interchangeables.
Mission Control transforme les opérations en produit
Mission Control ajoute la supervision, la maintenance, la réparation et le cycle de vie. Son importance se voit lorsque le travail est conséquent. Remplacer un composant dans un petit pool peut avoir un impact limité; diagnostiquer une liaison dégradée dans une allocation synchronisée détermine si des milliers d’heures d’accélérateur sont productives ou perdues.
La documentation de service décrit une surveillance proactive et une intervention. Cela établit le modèle prévu, pas une disponibilité vérifiée de manière indépendante ni une distribution publique du temps de réparation. L’absence d’un recensement complet des incidents importe parce que la fiabilité est une raison principale de payer un fournisseur plutôt que de construire le cluster.
Le stockage fait partie du calcul connecté
Les données d’entraînement, les points de contrôle et les artefacts empruntent des chemins de stockage qui peuvent limiter toute la charge. Un cluster avec une bande passante GPU exceptionnelle peut s’arrêter s’il ne lit pas les entrées, n’écrit pas les points de contrôle ou ne récupère pas l’état assez rapidement. La plateforme comprend du stockage d’objets et de fichiers et décrit le mouvement de données haute performance comme faisant partie du service.
Le trafic des points de contrôle crée un motif spécifique. De nombreux workers peuvent persister l’état de manière coordonnée, générant des rafales distinctes des collectives. Si le stockage partage des ressources physiques avec le fabric d’entraînement, la conception nécessite une isolation ou une capacité. S’il utilise un autre réseau, la plateforme doit toujours coordonner la défaillance et la récupération entre les deux chemins.
Le stockage influe également sur la portabilité. Apporter un modèle à CoreWeave peut nécessiter d’importants transferts depuis un autre cloud ou un environnement privé. Le faire sortir peut générer des coûts, du temps et des frictions contractuelles. « Zero Egress Migration » est un mécanisme commercial destiné à réduire certains coûts de migration vers CoreWeave; ce n’est ni une garantie technique, ni une exonération universelle des frais de sortie, ni la preuve que le déplacement des données est sans coût opérationnel.
Le client doit demander des preuves de bout en bout. Les benchmarks d’accélérateur ou de fabric sont utiles, mais la production inclut la préparation des données, les points de contrôle, les journaux de modèles, les logs et la récupération. Un test qui isole une couche ne répond pas à la question de savoir combien de temps il faut ni combien cela coûte de terminer le travail réel.
Le backbone relie les régions, pas un seul supercalculateur synchrone
CoreWeave décrit un backbone de classe opérateur qui relie les centres de données d’Amérique du Nord et d’Europe par fibre terrestre et sous-marine, peering direct et services privés. Le dépôt réglementaire mentionne Direct Connect à 10, 100 et 400 Gbit/s, selon l’emplacement et la disponibilité.
Le backbone a une fonction distincte du fabric local scale-out. Il déplace les jeux de données, les répliques, les points de contrôle, le contrôle et l’inférence entre les régions; il connecte les utilisateurs et d’autres clouds; il soutient la reprise et la distribution. La latence longue distance l’empêche de transformer des centres distants en un seul fabric d’entraînement à faible latence pour des travaux couplés.
La connectivité privée réduit un type d’incertitude
Un circuit dédié évite une partie de la variabilité de l’Internet public et offre des limites plus claires de capacité et de support. Il ne crée pas un monde entièrement privé de bout en bout. L’accès peut dépendre d’un opérateur, d’une interconnexion et de l’exploitant du centre. Les rampes d’accès au cloud ont leurs propres validations. La propriété physique ou la diversité de chemin n’est pas révélée pour chaque emplacement.
Pour cette raison, CoreWeave ne doit pas être décrit comme un opérateur Tier 1. Il exploite un backbone et fait du peering, mais les preuves ne démontrent pas une portée mondiale sans compensation ni la propriété de toute la fibre. Son avantage est l’accès intégré à sa propre capacité de calcul, pas de remplacer l’écosystème mondial des télécommunications.
La conception régionale crée des décisions de disponibilité
CoreWeave a déclaré des installations dans six pays à la fin de 2025. Le décompte ne signifie pas que chaque génération, fabric, service ou vitesse privée est disponible dans chaque pays. Les régions sont ouvertes par phases car l’alimentation, le refroidissement, le réseau, le matériel et la préparation opérationnelle n’arrivent pas en même temps.
La géographie affecte plus que la latence: la gouvernance des données, la proximité d’autres clouds, le personnel, l’origine de l’électricité, la corrélation des pannes et qui contrôle le chemin local. Pour CoreWeave, chaque pays ajoute une coordination juridique, des services publics et d’approvisionnement en plus de la capacité. L’expansion est un modèle opérationnel, pas une carte de boîtes identiques.
La fiabilité transforme le capital en temps utile
Le matériel reste financé, que le travail progresse ou attende. C’est pourquoi la fiabilité est une variable financière. Une panne de fabric, un GPU dégradé, un blocage du stockage ou une erreur du planificateur réduit la production utile et facturable pendant que les intérêts, les baux et l’électricité continuent.
Les retardataires importent plus que les pannes complètes
Un nœud mort est visible. Un retardataire peut rester vivant tout en ralentissant chaque synchronisation. Les grands travaux ont besoin de télémétrie qui détecte la dégradation, pas seulement la santé binaire. Le planificateur et les opérations doivent décider s’il faut drainer, remplacer ou continuer à utiliser le composant.
Les informations publiques ne fournissent pas une distribution complète des échecs de travaux, de la latence de queue ou de l’incidence des retardataires. Cela ne prouve pas une mauvaise fiabilité, mais limite la comparaison indépendante. Les clients doivent s’appuyer sur le contrat, les tests de charge et leurs propres preuves, pas extrapoler à partir des diagrammes.
La qualification est un test du système
Avant d’exposer un cluster, CoreWeave doit qualifier les serveurs, les commutateurs, les optiques, les câbles, le firmware, les pilotes, le stockage et l’orchestration dans leur ensemble. Un démarrage correct ne suffit pas. Le test utile vérifie si la topologie soutient la charge, survit aux pannes et se répare sans générer d’incohérence.
La qualification évolue avec le temps. Une conception testée avec un ensemble logiciel donné peut se comporter différemment après une mise à jour. L’arrivée rapide des générations NVIDIA multiplie les combinaisons tandis que les anciens environnements restent sous contrat. La maturité consiste à gérer le chevauchement sans transformer chaque installation en une exception unique.
Les finances sont une couche de l’architecture
CoreWeave a déclaré 5,1 milliards de dollars de revenus en 2025 et une perte nette de 1,2 milliard. Elle a payé 10,3 milliards en espèces pour les immobilisations et équipements. À la clôture, les obligations de performance restantes s’élevaient à 60,7 milliards. Le dépôt décrivait également le financement d’équipements, la dette, les baux et des engagements d’infrastructure très élevés.
Ces chiffres signifient des choses différentes. Les revenus sont des services reconnus. Les liquidités versées pour les actifs sont une sortie d’investissement, pas une valorisation de l’ensemble de la flotte. La perte montre que la croissance n’a pas produit de rentabilité consolidée. Les obligations restantes représentent les performances futures sous contrat selon les normes comptables, non des liquidités disponibles ni des services livrés.
Le premier trimestre 2026 a montré la demande et le coût de traîne
Pour le trimestre clos le 31 mars 2026, CoreWeave a déclaré 2,078 milliards de dollars de revenus, 740 millions de perte et 536 millions d’intérêts. Elle a également communiqué 99,4 milliards de carnet de commandes selon sa propre définition. Les données montrent à la fois une demande visible et une lourde charge de financement.
Le carnet de commandes n’est pas directement interchangeable avec les obligations de fin d’année; leur définition et leur date diffèrent. Tous deux indiquent une demande future, mais les convertir exige de mettre en service des centres, de la puissance, du matériel et du réseau, puis d’exécuter les contrats. Plus le carnet est convaincant, plus grande est l’obligation de livraison qui l’accompagne.
Le financement adossé aux GPU aligne les actifs et les contrats
CoreWeave a eu recours à des prêts garantis, à du financement d’équipements et à des structures adossées à des clients. En juin 2026, elle a annoncé une facilité de 8,5 milliards décrite comme adossée à des GPU et bénéficiant d’une notation investment grade pour cette opération. Cela augmente la capacité de déploiement; ce n’est pas un revenu et cela ne signifie pas que toute la dette de l’entreprise ait cette notation.
Le financement d’actifs peut aligner la dette, le matériel et les flux contractuels. Il restreint également les garanties, le déploiement et l’utilisation des liquidités. Les accélérateurs, les commutateurs et les optiques vieillissent vite par rapport aux infrastructures traditionnelles. Le modèle fonctionne si l’utilisation reste élevée et si les contrats couvrent la période de plus grande valeur économique de l’équipement.
La conception du réseau affecte ainsi la qualité de crédit. Une topologie qui augmente l’utilisation améliore la production de l’actif financé. Un centre retardé, des retardataires persistants ou une migration ratée la réduisent. Chez CoreWeave, l’ingénierie des systèmes et l’ingénierie du bilan sont une seule et même histoire.
La concentration de la clientèle est aussi une dépendance d’infrastructure
Microsoft a représenté 67 % des revenus de 2025. Un client d’ancrage peut justifier la capacité, soutenir le financement et donner confiance pour acheter à l’avance. La même concentration lui donne un pouvoir de négociation et fait que l’utilisation dépend d’une seule relation.
CoreWeave a annoncé ou déclaré des relations avec Meta et Anthropic; Flow Traders l’a sélectionnée pour entraîner des modèles fondationnels en juillet 2026 et Leidos a annoncé une collaboration pour l’IA de défense, de sécurité nationale et de renseignement. Les annonces prouvent des contrats, une sélection ou une collaboration au niveau décrit. Elles ne démontrent pas que la concentration a disparu ni que toute la capacité est active.
Les contrats take-or-pay transfèrent le risque, ne l’éliminent pas
Les contrats pluriannuels take-or-pay apportent de la visibilité et peuvent soutenir le financement. Ils transfèrent une partie du risque d’utilisation vers le client car les paiements engagés ne dépendent pas uniquement de la consommation immédiate. Ils n’éliminent pas le risque de construction, de puissance, de livraison, de performance, de crédit ou de renégociation.
Pour le client, le contrat investit une partie de la promesse du cloud. Le cloud public traditionnel met l’accent sur l’élasticité et un faible engagement. Un cluster dédié peut nécessiter une relation plus longue parce que le fournisseur construit ou réserve une capacité spécifique. L’interface ressemble à un logiciel cloud et la structure sous-jacente s’apparente au financement de projet.
La défense et la réglementation élèvent le seuil d’assurance
La collaboration avec Leidos du 30 juillet 2026 amène la plateforme vers des missions de défense et de renseignement. Elle n’atteste pas de toutes les autorisations, certifications ou mises en œuvre nécessaires. Elle indique que la sécurité, la chaîne d’approvisionnement, l’auditabilité et la continuité pourraient prendre plus de poids dans le produit.
Un VPC appliqué par DPU, une connectivité privée et des opérations gérées soutiennent des conceptions à haute sécurité. Ils ne remplacent pas les contrôles du programme, les exigences en personnel, le traitement des données ni l’approbation gouvernementale. Plus la charge est sensible, plus les limites de responsabilité doivent être transparentes.
Les acquisitions montent dans la pile et la fusion avortée visait vers le bas
Au cours de l’année 2025, CoreWeave a acquis Weights & Biases, OpenPipe, marimo et Monolith AI. Weights & Biases a ajouté le développement et l’observabilité des modèles; les autres ont étendu l’inférence, les notebooks et l’IA industrielle. Ces opérations font monter CoreWeave de l’infrastructure brute vers davantage d’étapes du cycle de développement.
La logique est claire. Un fournisseur qui comprend les flux de travail des modèles peut anticiper la demande, simplifier la consommation et fidéliser les clients. Le risque aussi: le logiciel a des cycles, des marges et des cultures différents de ceux des centres de données financés. Des chevauchements et des conflits avec des partenaires peuvent apparaître si CoreWeave tente de posséder des outils auparavant indépendants.
La proposition d’acquérir Core Scientific allait dans le sens descendant. CoreWeave a annoncé un accord en juillet 2025 qui aurait accru son contrôle sur la capacité des centres de données et les baux. Core Scientific l’a résilié le 30 octobre 2025 après le vote des actionnaires. CoreWeave n’a pas acquis l’entreprise.
Dans l’ensemble, les transactions révèlent une intégration vers le haut, vers les logiciels, et vers le bas, vers la capacité physique. La fusion avortée montre que le contrôle de l’infrastructure ne s’achète pas toujours au rythme souhaité par la plateforme. Les actionnaires, la réglementation, le financement et le contrat peuvent bloquer la logique technique de l’intégration verticale.
Ce que CoreWeave contrôle et ce qui reste en dehors
CoreWeave contrôle la plateforme client, de nombreuses décisions de conception, la qualification, l’orchestration et les opérations. Elle décide comment Nimbus représente les VPC, comment elle présente les clusters, ce qu’elle gère et comment elle répond aux incidents. Elle peut acheter du matériel tôt et concevoir des installations en fonction de la densité.
NVIDIA contrôle les feuilles de route critiques des GPU, NVLink, InfiniBand, Spectrum-X et BlueField. Les compagnies d’électricité et les partenaires de centres de données contrôlent une partie de la puissance et de la livraison. Les opérateurs, les points d’échange et les clouds contrôlent une partie de la connectivité externe. Les prêteurs limitent le capital. Les grands clients influencent par le biais des contrats.
Ce n’est pas un défaut exclusif: tout cloud dépend de fournisseurs. La concentration est importante parce que la différenciation de CoreWeave est étroitement liée au déploiement précoce de NVIDIA et que ses engagements sont énormes par rapport à son historique opérationnel. Un retard ou un changement de feuille de route peut se répercuter sur les clients et le financement.
La force est de coordonner les frontières. Le risque est la dépendance corrélée: une génération, une conception de centre ou un programme client peut affecter plusieurs couches. L’intégration réduit les contrats pour le client, mais augmente l’impact d’une défaillance du fournisseur.
Position concurrentielle: un cloud spécialisé répartit les responsabilités
CoreWeave est en concurrence avec les hyperscalers, d’autres clouds GPU, des clusters privés et des combinaisons de colocation, d’hébergement et d’intégration. Il ne suffit pas de compter les GPU ou de regarder un benchmark. Les acheteurs comparent la génération, le fabric, le stockage, la planification, la connectivité privée, le support, le contrat, la géographie et le coût de déplacement des données.
Face aux hyperscalers
AWS, Microsoft Azure, Google Cloud et Oracle offrent une largeur, des écosystèmes mondiaux et des bilans solides. Ils combinent l’IA avec des bases de données, la sécurité, l’analytique et des achats déjà en place. CoreWeave répond par la spécialisation: intégration rapide de générations NVIDIA sélectionnées, bare metal et conception pour la haute densité.
La spécialisation réduit l’abstraction et accélère la qualification, mais crée un profil plus étroit de fournisseur et de défaillance. Le client gagne un fournisseur concentré sur la charge, en acceptant une largeur moindre et une structure de capital plus jeune. La comparaison correcte est spécifique à chaque charge de travail.
Face aux autres clouds spécialisés
Lambda, Nebius, Crusoe et d’autres fournisseurs se chevauchent sur les accélérateurs, les clusters et la gestion. Ils diffèrent par la géographie, l’énergie, le logiciel, la propriété, le capital et le contrôle des centres. « Neocloud » est une étiquette, pas une architecture.
Les dépôts publics de CoreWeave apportent des preuves inhabituelles d’échelle et de risque, mais ne démontrent pas une supériorité technique ou économique. Un rival avec moins d’informations peut être plus petit, plus efficace ou simplement opaque. La transparence ne doit pas se transformer en classement.
Face à la construction de son propre cluster
Un cluster privé offre un contrôle direct du matériel, des données et des opérations, mais nécessite des achats, de l’énergie, des installations, du réseau, du stockage, de la sécurité, du firmware, des pièces de rechange et des spécialistes. CoreWeave vend le transfert d’une grande partie de cette charge.
Le transfert n’est pas complet. Le client conçoit les charges, gère les données, fixe les politiques et évalue le risque. Les engagements longs réduisent la mobilité. Un cluster propre risque la sous-utilisation; un contrat cloud, la dépendance. La décision économique est de savoir qui absorbe le mieux la variabilité et maintient productif le système coûteux.
La commutation liquide montre où le prochain goulot d’étranglement peut se déplacer
En juillet 2026, CoreWeave a décrit une commutation refroidie par liquide pour augmenter la bande passante par rack. Le chiffre provient de son architecture et de ses calculs, pas d’un test indépendant de toute la flotte. Le mécanisme importe: à mesure que la densité des accélérateurs augmente, les commutateurs et les optiques consomment de l’énergie et génèrent assez de chaleur pour limiter le rack.
Refroidir le commutateur avec du liquide permet plus de capacité dans une enveloppe donnée et peut-être des trajets de câble plus courts. Cela couple également la maintenance du réseau et le système hydraulique. Une fuite, une pompe ou une procédure de service peut affecter des équipements auparavant traités comme un réseau refroidi par air.
Ce changement montre comment les goulots d’étranglement migrent. Des GPU plus rapides exigent plus de scale-up; cela exige un scale-out plus dense; la densité exige plus de puissance et de refroidissement; les installations nécessitent une autre conception mécanique et électrique. Une génération de produit peut être une refonte du centre, pas une mise à jour de serveur.
Vera Rubin est une transition future, pas la flotte installée
La documentation de juillet 2026 décrit la préparation pour NVIDIA Vera Rubin NVL72 et fait des déclarations mesurées ou prospectives sur les tokens par mégawatt par rapport à Blackwell. Elles doivent être attribuées à CoreWeave et à cette configuration. Elles ne démontrent pas la disponibilité sur l’ensemble de la flotte à la date de la recherche.
Une nouvelle génération modifie l’accélérateur, le scale-up, le scale-out, la puissance, le refroidissement, le firmware, les pilotes, l’orchestration et la qualification. Elle peut améliorer la production par MW et rendre les anciennes installations moins compétitives. Adopter tôt n’est un avantage que si CoreWeave gère la migration, l’utilisation et la dépréciation des actifs précédents sous contrat.
Cela approfondit également la dépendance envers NVIDIA. L’accès précoce attire les clients et les contrats, mais expose au calendrier, au prix et à l’architecture du fournisseur. Diversifier les clients ou le logiciel ne diversifie pas nécessairement la couche physique.
L’effet sur l’infrastructure numérique au sens large
L’expansion affecte bien plus que la location de GPU. Des engagements de plusieurs gigawatts créent une demande de production, de réseau, de transformateurs, de refroidissement, de terrain et de construction. Des fabrics denses exigent des commutateurs, de l’optique et de la fibre. La connexion privée demande des opérateurs, des points d’échange et des rampes d’accès. Le financement exige des prêteurs capables d’évaluer une technologie à obsolescence rapide face à des contrats longs.
La plateforme modifie l’endroit où le trafic apparaît. L’entraînement couplé reste dans les fabrics locaux, tandis que les jeux de données, les points de contrôle, les artefacts, l’inférence et les flux de travail circulent entre les clouds, les centres et les utilisateurs. L’impact visible pourrait provenir moins d’un flux d’entraînement gigantesque que de mouvements persistants autour de celui-ci.
Pour les communautés et les réseaux électriques, la pile est une décision de puissance et de terrain. Le dossier ne permet pas une conclusion environnementale d’entreprise, mais établit que la puissance active et sous contrat sont des mesures centrales et que les retards sont un risque.
Pour les ingénieurs, l’architecture montre que l’infrastructure de l’IA devient une discipline à part entière. Le routage et la commutation se croisent avec les bibliothèques collectives, la topologie des accélérateurs, le refroidissement liquide, la planification et le financement de projet. Celui qui ajuste la congestion protège le travail et le service de la dette.
Ce que les preuves publiques ne montrent pas
CoreWeave publie de la documentation, des blogs et des dépôts réglementaires, mais la pile reste en partie opaque. Il n’y a pas de topologie complète, d’inventaire de fabric par centre, de tableaux de sursouscription, de carte de propriété de la fibre, d’historique complet des incidents ni d’archive indépendante de benchmarks par charge de travail dans le matériel fourni.
Cette limite doit orienter les affirmations. La documentation prouve les mécanismes; les documents SEC, les finances et les risques; un communiqué, une sélection ou une collaboration. Aucun ne prouve un résultat universel, une disponibilité de la flotte ni un coût total inférieur pour chaque acheteur.
La même prudence vaut pour l’échelle. La puissance active n’est pas la puissance sous contrat. Le carnet de commandes n’est pas le revenu. Une date programmée n’est pas un résultat. Un accord annoncé n’est pas une utilisation active. Une acquisition proposée n’est pas une propriété. Une génération future n’est pas la flotte actuelle.
Ces distinctions n’affaiblissent pas le profil: elles définissent le vide qu’un lecteur professionnel doit gérer. CoreWeave demande aux clients et aux capitaux de faire confiance à un système intégré dont les détails les plus précieux sont privés. La réponse rationnelle n’est pas de supposer l’excellence ou l’échec, mais d’exiger des preuves dans le contrat, le cluster et le centre spécifiques.
Le jugement central
Le produit de CoreWeave est souvent appelé capacité de calcul. Le produit plus profond est la coordination: entre la feuille de route et la construction, le scale-up et le scale-out, la DPU et l’intention du locataire, Kubernetes et la topologie, le stockage et les points de contrôle, le backbone et l’accès, le financement à long terme et les générations courtes.
La coordination peut créer un avantage réel. Un fournisseur spécialisé décide sur l’ensemble de la charge au lieu de demander au client d’assembler les pièces. Il peut qualifier, réparer et introduire des générations plus rapidement que beaucoup d’entreprises. La croissance suggère que de grands clients valorisent ce transfert.
L’intégration concentre les conséquences. Une conception, un retard, une erreur de politique, une restriction financière ou un changement de client peut affecter une grande partie du système. L’avenir ne dépend pas d’un chiffre de bande passante, mais de la capacité de toutes les couches à convertir la capacité financée en un travail fiable.
Briefing des membres
Contexte approfondi du profil
Connectez-vous avec le bon niveau d'adhésion pour débloquer le briefing complet et les notes de source.
Réservé à Strategic Circle
Strategic Circle
Ouvert à tous les lecteurs. Débloquez les briefings de profil après adhésion et connexion.
Rejoindre Strategic CircleRéservé aux membres de Leadership Alliance
Leadership Alliance
Réservé aux propriétaires et dirigeants qualifiés d'actifs IP ; connectez-vous pour débloquer les briefings Alliance.
Rejoindre Leadership Alliance
