Résumé

  • Sage Weil a développé Ceph dans le cadre d’un programme de recherche collaboratif à l’University of California, Santa Cruz, puis a achevé son doctorat en 2007 après la publication des articles fondateurs sur Ceph et CRUSH en 2006.
  • CRUSH calcule le placement à partir des cartes du cluster, des pondérations, de la topologie et des règles, sans table centrale de consultation; RADOS répartit le stockage des objets, la réplication, la gestion des pannes et la récupération entre les moniteurs et les OSD.
  • Ceph fournit du stockage bloc avec RBD, du stockage objet avec RGW et un système de fichiers de type POSIX avec CephFS. Ces interfaces reposent sur le même socle objet distribué, mais suivent des chemins de métadonnées et d’exploitation différents.
  • Weil a cofondé Inktank en 2012 et en a été le directeur technique. Le 30 avril 2014, Red Hat a annoncé son acquisition pour 175 millions de dollars, intégrant Ceph à une grande entreprise open source sans transformer le projet en stockage propriétaire.
  • Weil s’est ensuite retiré du travail à temps plein sur Ceph et est aujourd’hui fondateur et directeur général de Civic Media. L’autorité actuelle appartient à la communauté du projet, au Ceph Steering Committee et à l’Executive Council, et non à son créateur historique.

La baie de stockage devenue algorithme

Ceph a remis en cause l’idée selon laquelle un système de stockage avait besoin d’un catalogue central indiquant à chaque client où se trouvait chaque bloc. Son principe central consiste à rendre le placement calculable et à répartir une grande partie de la récupération dans le parc de stockage.

La principale contribution de Sage Weil n’est pas une fonctionnalité isolée, mais le refus architectural de conserver une table centrale d’allocation pour chaque objet. Avec CRUSH, clients et démons calculent l’emplacement prévu des données à partir d’une carte compacte et de règles de placement. Ce choix réduit la dépendance aux métadonnées et inscrit les domaines de panne dans l’algorithme. Il ne supprime toutefois ni les moniteurs, ni les groupes de placement, ni le trafic de récupération, ni le besoin d’une topologie exacte et d’un réglage opérationnel.

Ceph est né d’une recherche collaborative à l’University of California, Santa Cruz, et non d’un produit de jeune entreprise. L’article OSDI de 2006 est signé par Weil, Scott Brandt, Ethan Miller, Darrell Long et Carlos Maltzahn, avec l’appui de laboratoires et de financements publics. Ce travail a séparé les métadonnées de fichiers, le placement des objets et la récupération au niveau des périphériques. Weil peut être qualifié de fondateur, de co-créateur ou d’architecte d’origine, mais pas d’unique auteur de tous les mécanismes fondateurs.

L’architecture place RADOS à la base et lui superpose plusieurs formes de stockage. RBD fournit des périphériques bloc, RGW des protocoles objet et CephFS un espace de noms de système de fichiers. Un cluster peut ainsi desservir plusieurs couches d’infrastructure sans baie propriétaire distincte pour chaque interface. Cette unification peut aussi concentrer les pannes, la contention et la complexité si les charges ne sont pas correctement isolées et gouvernées.

CRUSH transforme les hypothèses physiques et organisationnelles de panne en politique. Sa carte décrit périphériques, hôtes, baies, salles ou centres de données, puis les règles répartissent répliques ou fragments à code d’effacement entre ces domaines. La règle ne vaut toutefois que par l’exactitude des libellés topologiques, des pondérations et de l’indépendance matérielle déclarée. Ceph distribue le travail sans éliminer la coordination: les moniteurs maintiennent les cartes et le quorum, les OSD s’accordent par groupes de placement, tandis que gestionnaires et orchestrateurs assurent contrôle et observabilité.

Une perte de quorum, une carte erronée, des groupes malsains ou une récupération saturée peuvent encore affecter tout le cluster.

Weil a contribué à transformer le système de recherche en projet d’entreprise pris en charge par Inktank, qu’il a cofondé en 2012 comme directeur technique. Red Hat a annoncé l’acquisition en 2014 et poursuivi les investissements dans l’ingénierie et l’industrialisation. Cette transition a financé les essais, le support et l’intégration tout en conservant un cœur open source. Elle ne fait pas de Red Hat l’unique propriétaire de la gouvernance et ne permet pas d’établir la fortune personnelle de Weil.

Le projet a institutionnalisé son existence au-delà du fondateur. La Ceph Foundation finance l’écosystème, tandis que la charte technique et les documents de gouvernance de 2026 attribuent la supervision au Ceph Steering Committee, à l’Executive Council et aux mainteneurs. L’autorité dépend désormais des rôles, des contributions et du processus communautaire. Les textes officiels ne révèlent pas toutes les influences d’employeurs, priorités financières ou décisions informelles.

La proposition opérationnelle de Ceph est la plus forte lorsque la panne est considérée comme normale et la récupération comme une charge planifiée. Les OSD détectent les changements, rapprochent les groupes de placement, répliquent ou reconstruisent les données et rééquilibrent le cluster. Des composants ordinaires peuvent donc former un stockage durable, mais la récupération utilise les mêmes disques et réseaux que les applications et peut provoquer un effondrement prolongé des performances si elle est mal gouvernée.

L’identité professionnelle actuelle de Weil n’est plus liée aux infrastructures de stockage. Les biographies de Civic Media et d’Urban Triage le présentent comme fondateur et directeur général de Civic Media, axé sur la radio locale, l’édition numérique et les institutions démocratiques. Aucun lien de gouvernance entre Civic Media et Ceph ne doit être déduit.

La thèse centrale est que Ceph a transformé l’achat de stockage, d’une boîte en un modèle d’exploitation. Le logiciel calcule le placement, répartit la réparation et expose des interfaces standard sur des parcs de serveurs et de disques. Ce modèle a élargi l’accès au stockage à grande échelle et influencé les infrastructures cloud et Kubernetes, tout en créant de nouvelles dépendances envers les compétences opérationnelles, le réseau, le matériel, les mises à niveau et la maintenance communautaire.

L’application choisit une interface bloc, objet ou fichier -> le client obtient les cartes et capacités actuelles -> l’identifiant d’objet est associé à un groupe de placement -> CRUSH calcule l’ensemble d’OSD actif selon la topologie et les règles -> l’OSD principal coordonne les écritures et la réplication ou le codage d’effacement -> les moniteurs maintiennent les cartes et le quorum -> l’accord, la récupération et le remplissage rétablissent l’état visé -> gestionnaires, orchestrateurs et opérateurs surveillent la santé, la maintenance et les mises à niveau.

Les preuves sur l’identité, la formation et le rôle actuel sont solides, même si aucun CV daté complet n’a été trouvé. Les articles évalués par les pairs établissent très fortement la paternité collaborative de Ceph et de CRUSH.

L’architecture actuelle de Ceph est très solidement documentée par les sources officielles et les dépôts. La chronologie d’Inktank et de Red Hat est solide. La gouvernance actuelle est très bien établie par la charte de 2026. Les preuves de déploiement et de performance sont plus modérées, faute de recensement indépendant universel. Les données financières personnelles sont insuffisantes et aucune estimation de fortune, rémunération ou participation ne doit être déduite. L’implication personnelle actuelle de Weil dans Ceph paraît limitée et aucun rôle opérationnel dirigeant n’a été identifié.

Sage Weil a contribué à rendre le stockage distribué calculable: CRUSH a remplacé les tables centrales de placement par une politique déterministe, tandis que RADOS répartissait réparation et déplacement des données. La survie de Ceph au-delà de sa direction fait partie de cette réussite, mais les performances, la gouvernance et les versions actuelles relèvent désormais de la communauté. Ceph constitue une infrastructure numérique parce qu’il peut porter l’état persistant de clouds, machines virtuelles, clusters Kubernetes, systèmes scientifiques et services objet.

La pertinence de Weil tient à cette frontière de conception. Ceph permet d’assembler le stockage à partir de serveurs, de disques et de réseaux plutôt que d’acheter une baie fermée contrôlant le placement. Il reste pourtant profondément physique: latence, endurance flash, surabonnement réseau, alimentation, refroidissement et domaines de panne déterminent si le modèle logiciel est fidèle. Les opérateurs cloud utilisent RBD, RGW et CephFS; les équipes Kubernetes passent par Rook et CSI, sans faire disparaître les contraintes de panne et de mise à niveau.

Les opérateurs OpenStack utilisent Ceph pour les images, volumes, disques éphémères et services objet, avec un risque de couplage entre plans de contrôle et de stockage. Les institutions scientifiques emploient CephFS et RADOS, mais les métadonnées et petits fichiers demandent une conception spécifique. Les équipes d’entreprise déplacent les obligations de personnel et de support vers les opérateurs et fournisseurs. Les fabricants fournissent disques, NIC, serveurs et accélérateurs dont la compatibilité et les micrologiciels restent hors de la gouvernance de Ceph.

Mainteneurs, fournisseurs commerciaux et propriétaires d’applications portent chacun une part distincte de la fiabilité.

Civic Media définit le contexte professionnel actuel de Weil sans relation opérationnelle avec Ceph. Weil ne contrôle pas aujourd’hui le Ceph Steering Committee, l’Executive Council ou le processus de publication. Il ne possède pas toutes les contributions, tous les sous-systèmes ou toutes les décisions de marque. Ceph ne fabrique pas le matériel; CRUSH ne peut pas vérifier l’indépendance physique des domaines déclarés; la redondance ne garantit pas la récupération après panne corrélée ou erreur administrative; un cluster sain ne prouve pas que les sauvegardes applicatives sont utilisables.

À long terme, Ceph a transformé l’architecture de stockage en politique transparente et programmable. Cette transparence rend aussi la responsabilité visible: l’opérateur doit assumer le modèle de panne, le budget de récupération, le chemin de mise à niveau et la preuve que les données peuvent réellement être restaurées.

CRUSH ne rend pas la topologie véridique à lui seul. Les pondérations, hiérarchies et règles sont des représentations entretenues par l’opérateur. Si elles ne suivent plus la réalité, le calcul déterministe peut reproduire un mauvais placement avec une parfaite cohérence.

Un groupe de recherche, pas un inventeur solitaire

Les récits de fondateur peuvent effacer les conditions de la recherche. Ceph est issu de l’UCSC Storage Systems Research Center, où articles, code, conseillers, coauteurs et financements institutionnels ont façonné l’architecture avec Weil.

Nom canonique: Sage A. Weil. Chercheur en systèmes distribués, fondateur open source et entrepreneur. Rôle public actuel: fondateur et directeur général de Civic Media. Aucun rôle formel actuel de chef de projet, membre de l’Executive Council ou du Steering Committee n’a été identifié au 6 août 2026; ces informations doivent être actualisées avant publication. Il est titulaire d’un BS en informatique du Harvey Mudd College et d’un doctorat de l’University of California, Santa Cruz, achevé en 2007. Ceph est né comme projet de recherche collaboratif à l’UCSC au milieu des années 2000.

L’article fondateur de Ceph à OSDI 2006 compte cinq auteurs et celui de CRUSH à SC 2006 en compte quatre. La thèse de 2007,Scalable Distributed Storage, consolide ces travaux. RADOS constitue le socle objet, CRUSH le mécanisme de placement, et RBD, RGW et CephFS les principales interfaces. Les serveurs de métadonnées de CephFS gèrent l’espace de noms; le quorum des moniteurs maintient les cartes; les groupes de placement structurent placement, accord et récupération. BlueStore est le moteur OSD par défaut des versions actuelles.

Inktank a été cofondé en 2012, avec Weil comme directeur technique. Red Hat a annoncé son acquisition le 30 avril 2014 pour 175 millions de dollars, somme correspondant à la transaction et non aux recettes personnelles de Weil. La Ceph Foundation existe depuis 2018 sous la Linux Foundation. La charte technique de 2026 a été adoptée le 12 février. Au 6 août 2026, l’Executive Council comprend Dan van der Ster, Neha Ojha et Patrick Donnelly. La dernière version stable vérifiée est Ceph Tentacle 20.2.3, publiée le 5 août 2026.

L’autre branche active est Squid 19.2.5, datée du 14 juillet 2026, et le dépôt source est github.com/ceph/ceph. Aucun recensement complet des déploiements n’est publié. La fortune personnelle ou les recettes tirées de Ceph ne sont pas établies. À la fin des années 1990 et en 2000, Weil étudiait l’informatique au Harvey Mudd College et participait à des projets Internet et d’hébergement. Au début des années 2000, il a rejoint le Storage Systems Research Center de l’UC Santa Cruz.

De 2004 à 2005, l’architecture initiale de Ceph et la recherche sur le stockage objet ont pris forme. En novembre 2006, les articles Ceph et CRUSH ont établi publiquement l’architecture du système de fichiers distribué et le placement calculable entre domaines de panne pondérés. En 2007, Weil a achevé sa thèse. De 2007 à 2011, le projet a évolué du prototype académique vers une infrastructure utilisable, et en 2010 son support a intégré l’écosystème du noyau Linux. En 2012, Inktank a créé un véhicule commercial de support et d’industrialisation.

Le 30 avril 2014, Red Hat a annoncé l’accord d’acquisition. De 2014 à 2020, Weil a travaillé dans l’Office of the CTO de Red Hat tout en poursuivant son action sur Ceph. En 2018, la Ceph Foundation a été créée comme fonds dirigé de la Linux Foundation. En 2020, Weil s’est retiré du travail à temps plein sur Ceph pour se consacrer aux droits de vote et à des projets civiques. Civic Media a été cofondée en 2022. Entre 2024 et 2026, Squid et Tentacle ont confirmé la continuité communautaire sans contrôle du fondateur.

La nouvelle charte du 12 février 2026 a formalisé la supervision du Ceph Steering Committee sous LF Projects. Tentacle 20.2.3 est sorti le 5 août 2026 et les dossiers publics du 6 août identifiaient toujours Weil comme fondateur et directeur général de Civic Media. L’origine de Ceph répondait au problème des structures centrales d’allocation et des serveurs de métadonnées à l’échelle du pétaoctet, afin que données et métadonnées puissent évoluer séparément et que la panne soit normale.

Les premiers résultats de référence décrivent l’environnement du prototype et non le matériel actuel ni toutes les charges de production. Les listes d’auteurs et remerciements montrent des apports intellectuels, techniques et financiers partagés. Les articles établissent la paternité formelle; la répartition informelle du travail et les contributions ultérieures exigeraient des entretiens ou l’étude des dépôts. CRUSH associe les groupes de placement à des ensembles ordonnés de périphériques selon les pondérations, la topologie et les règles.

Cette approche supprime une consultation centrale d’allocation du chemin d’E/S courant et transforme l’extension ou la perte d’un périphérique en changement de carte plutôt qu’en réécriture de base. Le déterminisme ne garantit ni équilibre, ni sécurité, ni faible coût. La réplication, la détection des pannes et la récupération sont déléguées aux démons de stockage objet. Cette responsabilité distribuée rend essentiels l’accord entre OSD, la limitation du remplissage, la fiabilité des horloges et réseaux ainsi que la visibilité opérationnelle.

Après le doctorat, des sociétés d’hébergement, Inktank, Red Hat puis la Ceph Foundation ont financé l’ingénierie, les essais, les versions et l’écosystème. Cette histoire montre qu’une architecture ouverte ne devient infrastructure qu’après des années d’investissement opérationnel. Le financement et l’emploi ne prouvent toutefois ni la propriété de toutes les contributions ni la neutralité des priorités.

Première phase, 2004-2007: l’équipe de l’UCSC construit et publie Ceph, CRUSH et la conception distribuée des métadonnées. Deuxième phase, 2007-2011: développeurs, intégrations au noyau, utilisateurs de production et interfaces plus stables font de Ceph une option d’infrastructure. Les preuves d’adoption initiale restent sélectives.

Troisième phase, 2012-2014: Inktank apporte support, emballage et services d’entreprise, sans publier tous ses financements, clients, marges ou participations. Quatrième phase, 2014-2018: Red Hat accélère RBD, RGW, CephFS, BlueStore, les essais et les intégrations. Les fonctions actuelles résultent d’un travail collectif et ne peuvent toutes être attribuées à Weil.

Cinquième phase, 2018-2022: la Ceph Foundation crée un foyer de financement multipartite tandis que Weil quitte progressivement le stockage. La succession communautaire remplace l’autorité du fondateur, même si la concentration des employeurs demeure pertinente. Sixième phase, 2023-2026: Steering Committee, Executive Council et équipes de composants guident Squid et Tentacle jusqu’à la nouvelle charte et aux versions actuelles. Les documents de gouvernance ne suppriment ni le risque de mise à niveau, ni la charge des mainteneurs, ni l’influence commerciale.

CRUSH: calculer où placer les données

CRUSH transforme une carte de cluster et une règle de placement en ensemble ordonné de périphériques. Il retire un service de consultation du chemin de données courant, mais le résultat dépend des pondérations, de la hiérarchie et des domaines de panne représentés.

Un profil de personne doit distinguer la direction créative historique de la gouvernance actuelle. La recherche et les années de direction de Weil ont été centrales, mais la charte de 2026 confie la supervision technique au Ceph Steering Committee. Les pages de gouvernance décrivent aussi un Executive Council de trois personnes et des responsables de composants. Le conseil de la Foundation soutient les budgets et l’écosystème sans contrôler directement la direction technique.

Sage Weil est co-créateur, architecte d’origine et ancien chef de projet. Scott A. Brandt, Ethan L. Miller, Darrell D. E. Long et Carlos Maltzahn portent des crédits fondateurs de recherche. Le Ceph Steering Committee assure la supervision actuelle; l’Executive Council arbitre et coordonne; les responsables et mainteneurs examinent, trient, publient et rétroportent. Le conseil de la Ceph Foundation soutient budgets et écosystème. Red Hat, IBM, Clyso et d’autres employeurs financent une part importante du travail sans posséder seuls le projet.

Civic Media est le contexte professionnel actuel de Weil et reste distincte de Ceph. La structure va des chercheurs et premiers collaborateurs aux contributeurs open source, puis à Inktank et Red Hat, aux membres de la Ceph Foundation, aux organes de gouvernance, aux mainteneurs et enfin aux opérateurs responsables des données, des domaines de panne et de la récupération. Cette transition témoigne de la maturité du projet.

La concentration des employeurs doit néanmoins être analysée: un vote ouvert peut coexister avec un accès inégal au temps d’ingénierie, au matériel de test et aux données d’incident. L’affirmation défendable est celle d’une gouvernance distribuée, non d’une absence d’influence.

UC Santa Cruz et le SSRC constituent l’origine; des laboratoires américains ont financé la recherche; DreamHost a soutenu la période postdoctorale; Inktank a commercialisé le support; Red Hat est devenu acquéreur et grand contributeur; LF Projects et la Ceph Foundation apportent l’infrastructure institutionnelle; OpenStack et Rook/Kubernetes sont des écosystèmes d’intégration; Civic Media reste séparée.

Les différents pouvoirs de l’écosystème — paternité scientifique, droits de maintenance, travail financé par les employeurs, budgets de la Foundation, obligations des fournisseurs et choix des opérateurs — ne doivent pas être présentés comme la propriété d’un acteur unique. Les intégrations OpenStack et Kubernetes facilitent l’adoption tout en ajoutant contrôleurs, dépendances de mise à niveau et domaines de panne.

Les finances de Weil, du projet et des entreprises sont distinctes. Les subventions ont soutenu la recherche; les capitaux privés et d’entreprise ont soutenu Inktank et Red Hat; les adhésions financent l’écosystème actuel; Civic Media possède une structure séparée. Rien ne justifie une estimation de fortune personnelle, l’attribution à Weil de la totalité du prix d’Inktank ou une valorisation autonome de Ceph.

Les financements originaux provenaient notamment de laboratoires publics américains, de la NSF et de partenaires de recherche, sans constituer un revenu personnel. La table de capitalisation complète d’Inktank n’est pas disponible. Les 175 millions de dollars de 2014 sont un prix d’acquisition d’entreprise. Aucun total d’investissement Ceph à vie ni revenu autonome du projet n’est publié. Civic Media indique en 2026 que Weil en est fondateur, investisseur majoritaire et bailleur important, sans relation de financement avec Ceph.

Les risques de pérennité comprennent la dépendance à quelques employeurs, le décalage entre priorités des membres et besoins des opérateurs, les correctifs conservés temporairement hors amont, le coût du matériel de test, les longues fenêtres de support et le coût humain masqué par l’accès libre au code. Ceph suit un modèle hybride associant code partagé, produits commerciaux, financement des membres et contributions des opérateurs.

La biographie de Weil relie la recherche californienne, les entreprises technologiques et aujourd’hui le Midwest américain avec Civic Media. L’empreinte de Ceph est toutefois mondiale et contrôlée par les opérateurs. Claremont correspond au contexte éducatif, Santa Cruz à l’origine de Ceph, l’écosystème d’hébergement californien aux premiers développements, Red Hat à l’ingénierie mondiale, la Linux Foundation à l’infrastructure organisationnelle et le Wisconsin aux activités actuelles de Civic Media.

Il n’existe pas d’inventaire public complet des clusters en production. La véritable question géographique consiste à savoir si les baies, salles et sites d’une carte CRUSH correspondent à des domaines réellement indépendants d’alimentation, de réseau et d’exploitation. La résilience géographique est un fait de mise en œuvre, non une propriété héritée du logiciel.

RADOS et le choix de distribuer la réparation

RADOS transforme de nombreux démons de stockage objet en un socle logique unique. Les moniteurs maintiennent les cartes et le quorum, tandis que les OSD stockent, s’accordent, répliquent et récupèrent les objets au plus près de leur état.

Le parcours de Weil couvre recherche, direction de projet, création d’entreprise et transition vers les médias civiques. Ceph sépare métadonnées de fichiers, placement et stockage objet; CRUSH calcule le placement; RADOS stocke, réplique ou code les objets et répare les pannes. Les bénéficiaires incluent chercheurs, opérateurs cloud, développeurs, clients Ceph, OSD et exploitants. Les limites tiennent à la paternité collective, aux erreurs de topologie et à la concurrence entre récupération et charges utiles.

CephFS fournit un espace de noms distribué avec des MDS; RBD expose des images bloc, instantanés et clones; RGW fournit des interfaces compatibles S3 et Swift. Chaque service repose sur RADOS mais possède ses propres limites: points chauds de métadonnées, latence réseau, comportement de récupération, compatibilité de protocole ou coûts d’indexation. La direction historique de Weil a transformé la recherche en projet durable sans constituer un contrôle actuel.

Un stockage objet, trois interfaces

L’ambition de Ceph consistait à prendre en charge plusieurs produits de stockage sans créer des moteurs distincts. RBD, RGW et CephFS partagent RADOS, mais présentent des contrats, goulets d’étranglement et modes de panne différents.

Inktank a fourni support et industrialisation aux organisations déployant du stockage en production, avec des données économiques privées incomplètes. Red Hat a intégré Ceph à ses portefeuilles Linux et cloud et accru les investissements, sans que sa stratégie soit identique à celle de la communauté amont.

La promotion de l’open source a aidé à expliquer le stockage défini par logiciel et la gouvernance communautaire, mais les affirmations de promotion exigent des preuves opérationnelles indépendantes. Civic Media exploite des radios locales et des plateformes numériques pour les auditeurs, journalistes et communautés; cette activité actuelle n’est pas une fonction de gouvernance de Ceph.

Le travail civique et associatif explique la transition après Ceph sans devoir être confondu avec les résultats techniques. L’influence intellectuelle de Weil persiste dans les concepts développés par de nombreux mainteneurs, mais elle est difficile à mesurer et n’implique aucune autorité présente.

Le passage de la recherche à Inktank constitue une étude de cas sur la pérennisation d’un logiciel d’infrastructure, sans modèle commercial universel. Ceph n’est pas une invention figée: système d’exploitation, moteur de stockage, passerelle, système de fichiers et orchestration ont évolué grâce aux mainteneurs ultérieurs. L’architecture ouverte donne aux utilisateurs le choix du matériel, des distributions et des prestataires, avec l’obligation d’en valider la combinaison.

Groupes de placement, récupération et coût des pannes

Les groupes de placement rendent gérable un immense espace d’objets en les regroupant pour le placement et la récupération. Ils transforment aussi la panne en mouvement contrôlé de données dont le coût réseau, disque et humain peut dominer un cluster dégradé.

La continuité du projet après le départ du créateur est un test important de réussite. Ceph associe d’abord les objets à des groupes de placement, puis ces groupes aux OSD. Cette indirection limite l’état nécessaire et fournit une unité de récupération gérable. Un nombre trop faible ou trop élevé de groupes peut néanmoins provoquer déséquilibre, surcharge ou récupération lente; l’ajustement automatique ne supprime pas la planification de capacité.

La carte CRUSH modélise OSD, hôtes, baies et centres de données. Des règles répartissent répliques ou fragments selon une sélection déterministe pondérée. Des classes, poids ou libellés erronés peuvent respecter la règle tout en violant l’indépendance réelle. Les moniteurs maintiennent par consensus les cartes des OSD, moniteurs, pools, authentifications et autres états critiques. La perte de quorum ou des cartes incorrectes peut bloquer les changements même si les disques sont intacts.

Pour chaque groupe de placement, un OSD principal coordonne les écritures vers les répliques ou fragments. Un principal lent, une asymétrie réseau ou une forte latence peut dominer les performances. Après un changement, les OSD comparent les historiques, choisissent l’état faisant autorité et reconstruisent les objets manquants. Des historiques incomplets, des objets perdus ou trop de récupérations simultanées peuvent prolonger l’indisponibilité et exiger le jugement de l’opérateur.

Du code doctoral à l’infrastructure Linux

Un prototype ne devient infrastructure qu’après des années d’empaquetage, d’intégration au noyau, d’essais, de documentation et de corrections en production. Le parcours de Ceph dans Linux et le cloud a autant compté que l’originalité des articles.

Lors de l’ajout, du retrait ou de la repondération de périphériques, CRUSH modifie le placement prévu d’une partie des groupes. Les OSD déplacent les données tandis que les limites et ordonnanceurs arbitrent entre récupération et trafic client. Cette migration consomme réseau, processeur et disques et peut créer une longue dégradation dans les grands clusters chargés.

Les pools utilisent réplication complète ou codage d’effacement. La réplication échange de la capacité contre une récupération et de petites E/S plus simples; le codage améliore la capacité utile au prix de calculs et d’amplification d’écriture. Petits objets, écritures partielles, nombre de domaines de panne et conditions de récupération modifient fortement le résultat.

BlueStore écrit directement sur les périphériques bruts et utilise RocksDB et BlueFS pour les métadonnées. Dimensionnement de base, endurance flash, débordement, fragmentation et micrologiciels peuvent compromettre un cluster bien conçu. CephFS délègue espace de noms, capacités et cache aux MDS, tandis que les clients accèdent aux données via RADOS. Répertoires très sollicités, récupération de sessions et métadonnées endommagées demandent une expertise spécialisée.

RBD associe les images bloc à des objets et prend en charge instantanés, clones, superposition et réplication miroir. La latence applicative, le cloisonnement, le verrouillage exclusif et la récupération doivent être validés pour chaque plateforme. RGW traduit les opérations S3 ou Swift en objets, métadonnées et index RADOS; compatibilité d’API, index de compartiments, retard multisite et petits objets diffèrent des performances RADOS brutes.

Inktank, Red Hat et responsabilité commerciale

Inktank a apporté support commercial et ingénierie autour du projet ouvert; l’acquisition par Red Hat a donné à Ceph une base d’entreprise plus large. La transaction a fourni des ressources et une responsabilité commerciale tout en soulevant la question de l’influence du fournisseur.

Ceph authentifie les clients et attribue des capacités limitées aux pools, espaces de noms et services. La distribution des clés, les autorisations trop larges, les clients compromis et l’accès au plan de gestion restent des risques. cephadm déploie des démons conteneurisés et l’orchestrateur réconcilie les spécifications de service, mais une mauvaise image, dépendance, spécification ou mise à niveau peut diffuser rapidement une panne.

Les OSD effectuent des vérifications régulières et approfondies des métadonnées et sommes de contrôle. Ces opérations consomment des E/S et ne garantissent pas une réparation sans perte lorsqu’aucune copie fiable ne subsiste. Ceph maintient des branches majeures, des rétroportages et des chemins de mise à niveau ordonnés. Il n’existe pas de procédure générale de retour en arrière et un cluster malsain n’est pas un candidat sûr à la mise à niveau.

La gouvernance actuelle attribue l’autorité technique aux mainteneurs, responsables de composants, au Steering Committee et à l’Executive Council. Les rôles peuvent tourner et les décisions suivent la participation et le consensus plutôt qu’un privilège de fondateur. L’ouverture formelle ne garantit toutefois ni l’égalité des ressources entre employeurs ni un consensus rapide.

Le projet apprend à vivre sans son fondateur

La preuve la plus forte de la réussite d’un fondateur est la continuité du projet après son retrait. Le passage de Weil aux technologies civiques rend les mainteneurs actuels responsables des performances et de la gouvernance présentes de Ceph.

  1. Formation de la recherche à l’UCSC: un groupe a traité ensemble échelle, panne et métadonnées. Publications OSDI et CRUSH: l’évaluation par les pairs a établi la conception et sa paternité collaborative en 2006. Le support du noyau et des distributions a rapproché Ceph d’un usage courant. Inktank a assumé le support et l’industrialisation. L’acquisition par Red Hat a fourni portée et personnel. Le financement est ensuite passé à un modèle multipartite. Le départ de Weil a testé la continuité communautaire. La charte de 2026 a formalisé la supervision technique. La branche Tentacle confirme près de vingt ans de maintenance. Il faut suivre les archives, la divergence avec le prototype, la compatibilité, la diversité des employeurs, la transparence budgétaire, tout rôle futur de Weil et l’adoption des mises à niveau.

Réduire un système de recherche à cinq auteurs et des années de travail communautaire à « Weil a créé Ceph » efface les collaborateurs et propriétaires ultérieurs de sous-systèmes. Il faut parler de co-créateur, de fondateur ou d’architecte d’origine, citer les coauteurs et rappeler la gouvernance actuelle.

Le placement calculé peut encoder une fausse topologie. Une diversité logique peut masquer une alimentation, un contrôleur, un commutateur ou un bâtiment commun. Toute affirmation de résilience doit donc être liée à une topologie précise et à la preuve de l’indépendance physique.

Remplissage, reconstruction et vérification concurrencent la production. Un cluster peut rester disponible tout en infligeant une longue hausse de latence ou une baisse de débit. L’analyse doit inclure budgets de récupération, limites et marge de capacité, ainsi que personnel, observabilité, support et procédures testées.

Le nombre de groupes, les seuils de remplissage et la conception des pools influencent équilibre et récupération. Les petits objets et métadonnées peuvent coûter bien davantage que leur charge utile. Les résultats sur gros objets séquentiels ne doivent pas être généralisés. Les erreurs administratives, identifiants partagés et commandes larges peuvent propager une panne plus vite qu’un processus manuel.

Les changements sur disque, de protocole et de fonctions suivent des chemins pris en charge sans retour simple. Il faut dater les recommandations, tester les mises à niveau par étapes et prévoir la reprise au niveau du service. Les distributions commerciales, rétroportages et contrats diffèrent de l’amont; toute analyse doit nommer version, distribution et support exacts.

Les biographies anciennes peuvent encore présenter Weil comme dirigeant de Ceph. Il faut employer son rôle actuel chez Civic Media et qualifier sa direction de Ceph d’historique. En l’absence de recensement indépendant, les dépôts, télémétries et références de fournisseurs ne mesurent pas toute la base installée.

Les preuves établissent des compromis architecturaux, des influences commerciales et des risques d’attribution, mais aucun comportement personnel répréhensible. Une analyse critique ne doit pas fabriquer de controverse à partir de la complexité ou d’un changement de carrière; les questions de gouvernance doivent rester séparées des allégations.

Le profil comporte donc deux chronologies: celle de Weil, de la recherche doctorale à Inktank, Red Hat puis Civic Media, et celle de Ceph, devenu une institution capable de publier et décider après son départ. La seconde est le meilleur test de la durabilité de l’infrastructure.