Zusammenfassung
- NVM Express, Inc. ist das gemeinnützige Konsortium, das die NVMe-Familie steuert; es stellt keine SSDs, Controller, Switches oder Speichersysteme her.
- NVMe ersetzte überkommene Annahmen mechanischer Festplatten durch mehrere Submission- und Completion-Queues im Speicher, die besser zu parallelem Flash und Multicore-CPUs passen.
- Dasselbe Modell aus Controller, Subsystem und Namespace kann lokal über PCIe oder remote per NVMe over Fabrics betrieben werden, mit TCP- und RDMA-Transports unterschiedlicher Betriebsprofile.
- NVMe 2.x ist modular. Das Bündel 2.4, veröffentlicht am 4. August 2026, koordiniert Base, die Transporte PCIe/RDMA/TCP, NVMe-MI, Boot und mehrere spezialisierte Command Sets.
- Das Protokoll macht den Zugriff auf Speicherkapazität komposabler. Es definiert kein Dateisystem, keine Haltbarkeit, kein RAID, kein Erasure Coding, kein Netzwerkdesign, keine Betriebssicherheit und keine Anwendungskonsistenz.
Ein Speicherbefehl kann den Server verlassen, ohne die grundlegende Sprache zu wechseln
Eine Leseoperation kann sich über PCIe an einen lokalen NVMe-Namespace oder über ein Fabric an ein entferntes Subsystem richten. Medium, Controller und Pfad ändern sich, das Befehlsmodell bleibt erhalten.
Diese Kontinuität ermöglicht Disaggregation. Kapazität kann gebündelt und je nach Bedarf Hosts zugewiesen werden, statt jedes Gerät im eigenen Chassis zu installieren.
Disaggregation fügt Abhängigkeiten hinzu: Discovery, Netz, Multipath, Authentifizierung, Wiederverbindung und neue Fehlerdomänen. NVMe macht Speicher zu einem programmierbaren Dienst, nicht zu einer Ressource ohne Topologie.
Flash brauchte ein für Parallelität entworfenes Protokoll
Historische Schnittstellen spiegelten mechanische Latenz und schmale Warteschlangen wider. Flash kann viele Operationen parallel bedienen, und moderne Server haben zahlreiche Cores.
NVMe nutzt Paare aus Submission- und Completion-Queues im Speicher. Der Host platziert Befehle, aktualisiert Doorbells und erhält Completions per Interrupts oder Polling. Viele Queues reduzieren gemeinsame Locks und lassen sich bestimmten Cores zuordnen.
Das Ergebnis hängt von Firmware, PCIe, NUMA, Queue-Tiefe, Interrupts und Workload ab. Der Protokollname garantiert kein universelles Leistungsniveau.
Das Konsortium trennt Protokoll-Governance und Produktwettbewerb
Die Arbeit begann Ende der 2000er-Jahre; NVMe 1.0 erschien 2011, und NVM Express, Inc. wurde 2014 gegründet. Beteiligt sind Unternehmen aus CPU, Medien, Controller, Networking, Systemen und Cloud.
Zum Stichtag war Amber Huffman von Google President, Curtis Ballard von AMD Treasurer und David Allen von Microchip Secretary. Das öffentliche Board umfasste dreizehn Promoter-Vertreter.
Das Konsortium definiert Verträge und Compliance-Programme. Die Mitglieder konkurrieren bei Silizium, Firmware, Systemen, Support und Leistung. Die Mitgliedschaft beweist nicht, dass ein Produkt alle Funktionen implementiert.
NVMe 2.0 machte aus einem wachsenden Dokument eine modulare Familie
Mit mehreren Transporten und neuen Datenmodellen wurde eine einzige Spezifikation schwer wartbar. Die Umstrukturierung 2.0 von 2021 trennte Base, Command Sets und Transports.
So kann sich TCP weiterentwickeln, ohne jeden Befehl neu zu schreiben, und ZNS kann voranschreiten, ohne alle herkömmlichen Controller zu ändern. Die Kehrseite ist eine komplexere Versionsmatrix.
Das Bündel 2.4, veröffentlicht am 4. August 2026, koordinierte Base 2.4, PCIe 1.4, RDMA 1.3, TCP 1.3, NVMe-MI 2.2, Boot 1.4 sowie die Command Sets NVM, Key Value, Zoned Namespace, Computational Programs und Simple Log Memory. Es ist keine einzelne Datei.
Submission- und Completion-Queues bringen die Arbeit näher an die Cores
Der Host schreibt Befehle in eine Submission Queue; der Controller gibt den Status in der Completion Queue zurück. Verschiedene Cores oder Prozesse können unterschiedliche Paare nutzen und so Konflikte verringern.
Doorbells melden neue Arbeit. Polling kann die Latenz senken, kostet aber CPU; Interrupt-Coalescing kann Zyklen sparen und Wartezeit hinzufügen. Die Queue-Tiefe verändert Auslastung und Tail Latency.
Eine tiefere Queue ist nicht immer besser. Sie kann Sättigung verbergen und die Wartezeit erhöhen. Die Konfiguration muss dem Workload folgen.
Controller, Subsysteme und Namespaces trennen logischen Endpunkt und physisches Medium
Ein Controller stellt Queues und Befehle bereit. Ein Subsystem kann mehrere Controller bündeln. Namespaces repräsentieren logische Kapazität und können über mehrere Pfade verfügbar sein.
Die vom Host sichtbare Identität muss nicht mehr mit einer SSD übereinstimmen. Ein Array kann viele Medien aggregieren und stabile Namespaces anbieten.
NVMe entscheidet nicht über Platzierung, Replikation oder Schutz der Daten. RAID, Erasure Coding, Thin Provisioning und Konsistenz gehören zum übergeordneten System.
Administrative Befehle steuern die I/O-Umgebung
Die Admin Queue verwaltet Identifizierung, Queue-Erstellung, Features, Logs, Firmware, Namespaces und Sicherheit. Sie ist die Ebene, die den normalen Betrieb ermöglicht.
Ein administrativer Befehl kann einen Namespace löschen, falsche Firmware aktivieren oder den Power State ändern. Er erfordert Berechtigungen, Audit und Change Control.
Die Trennung von Admin und I/O verbessert die Architektur, verringert aber nicht die Bedeutung der Control Plane. In Fabrics können beide von demselben Netz abhängen.
PCIe hält den lokalen Pfad nahe an Speicher und Hardware
NVMe über PCIe nutzt gemeinsamen Speicher und Controller-Register im lokalen Bus. Es ist die direkteste Möglichkeit, SSDs oder Karten im Server anzuschließen.
Die Topologie zählt weiterhin. Ein Gerät kann hinter einem PCIe-Switch, in einem anderen NUMA-Socket liegen oder Lanes teilen. CPU, Speicher und Device müssen gut platziert sein.
Darum reicht es nicht, die „Anzahl der Drives“ zu inventarisieren. Ein Teil der Latenz kann im Server entstehen, bevor das Medium erreicht wird.
NVMe over Fabrics macht aus einer lokalen Beziehung einen Netzdienst
NVMe-oF 1.0 und NVMe-MI 1.0 wurden am 9. Juni 2016 veröffentlicht. NVMe-oF transportiert Capsules und Daten zu einem entfernten Subsystem, wo der Host Queues anlegt und Namespaces über das Netz sieht.
Die Architektur ermöglicht gemeinsame Pools und die Trennung von Compute und Storage. Hosts können wechseln, ohne Daten zu verschieben.
Sie fügt NIC, Switch, Routing, Discovery, Controller, Authentifizierung und Multipath zum Datenpfad hinzu. Das Network Fabric wird Teil des Integritätssystems.
Discovery-Controller ermöglichen Dynamik und schaffen eine kritische Abhängigkeit
Ein Host fragt einen Discovery-Controller ab, um Subsysteme, Adressen und Dienste zu erfahren. Das vermeidet die manuelle Konfiguration jedes Targets.
Falsche Informationen oder ein nicht verfügbarer Dienst können neue Verbindungen verhindern oder den Host an die falsche Stelle führen. Nötig sind Redundanz, Caches, Validierung und Identitätsschutz.
Discovery ist nicht gleichbedeutend mit Verfügbarkeit des Datenpfads. Bestehende Verbindungen können bestehen bleiben, während neue Hosts nichts entdecken.
NVMe/TCP brachte das Fabric in gewöhnliche IP-Netze
NVMe/TCP, 2019 standardisiert, bildet Befehle und Daten auf TCP ab. Betreiber können routbares Ethernet, IP-Werkzeuge, Firewalls und vertraute Verfahren nutzen, ohne RDMA aufzubauen.
Die Einfachheit fügt Overhead hinzu. TCP, Copies, Interrupts und CPU können die Tail Latency beeinflussen. Kernel, Offloads, Übertragungsgröße und Tuning sind entscheidend.
Der Transport umfasst spezifisches Framing und Digests und kann TLS verwenden. Die TLS-Fähigkeit bedeutet nicht, dass sie aktiviert oder gut betrieben wird.
NVMe/RDMA strebt niedrige Latenz mit mehr Fabric-Disziplin an
RDMA nutzt Queue Pairs, registrierten Speicher und NIC-Fähigkeiten, um Daten mit weniger CPU-Beteiligung zu bewegen. Das ist attraktiv für HPC und KI.
RDMA ist kein einzelnes Netz. RoCE, iWARP und andere Bindings haben unterschiedliche Anforderungen an Congestion, Loss, PFC, ECN und Speicher.
Ein schneller Benchmark belegt keinen einfachen Betrieb. Ein Netzproblem kann als Storage-Timeout erscheinen und kombinierte Fähigkeiten erfordern.
Multipath macht Redundanz zur Entscheidung des Hosts
Ein Namespace kann über mehrere Controller und Pfade sichtbar sein. Der Host wählt Lastverteilung oder Failover. Asymmetric Namespace Access kennzeichnet Pfade als optimized, non-optimized oder unavailable.
Zwei Verbindungen können Switch, Controller, Stromversorgung oder Route teilen. Die Unabhängigkeit muss mit echten Ausfällen getestet werden.
Eine falsche Richtlinie kann I/O über einen langsamen Pfad senden oder zögern, einen toten Pfad zu verlassen. Redundanz ist beobachtetes Verhalten, keine Portzahl.
Reservations koordinieren gemeinsamen Zugriff, ohne Konsens zu ersetzen
NVMe Reservations erlaubt es, Hosts zu registrieren und einen Namespace zu reservieren, um unbefugte Schreiber zu verhindern. Das ist nützlich in Clustern und beim Failover.
Es ersetzt weder den Cluster-Konsens noch die Anwendungskonsistenz. Ein ausgefallener Host kann Zustand hinterlassen, der bereinigt werden muss, und Fencing muss verhindern, dass ein alter Knoten weiter schreibt.
Eine falsch wiederhergestellte Reservation kann Nichtverfügbarkeit oder Korruption verursachen.
Authentifizierung und TLS werden wichtig, sobald Speicher PCIe verlässt
Ein lokales Gerät erbte eine gewisse physische Grenze. Im Netz müssen Initiator und Target Identitäten authentifizieren und Kanäle schützen.
NVMe definiert Authentifizierungsmechanismen, und TCP kann TLS nutzen. Das Ergebnis hängt von Schlüsseln, Zertifikaten, Erneuerung, Algorithmen und Policy ab. Unterstützung ist keine sichere Konfiguration.
Discovery-, Admin- und Datenebenen müssen gemeinsam betrachtet werden. Eine authentische Identität kann weiterhin überhöhte Berechtigungen haben.
NVMe-MI schafft eine von I/O getrennte Verwaltungsebene
Die NVMe Management Interface ermöglicht es, Subsysteme zu inventarisieren, den Zustand zu lesen und Operationen auszuführen, auch wenn der Anwendungspfad nicht aktiv ist.
Das hilft bei Wartung und Recovery, fügt aber eine weitere privilegierte Schnittstelle hinzu. Eine Verwaltungsplattform kann sensible Informationen lesen oder Geräte in großem Umfang verändern.
NVMe-MI integriert sich mit Redfish und anderen Systemen. Die Integration verschmilzt nicht die Zuständigkeiten der einzelnen Standards.
Zoned Namespaces macht Medienbeschränkungen für die Software sichtbar
ZNS teilt Kapazität in Zonen, die sequenziell beschrieben werden. Durch die Sichtbarkeit für den Host kann es internes Garbage Collection reduzieren und Endurance oder Vorhersagbarkeit verbessern.
Der Nutzen setzt ein zones-bewusstes Dateisystem, eine zones-bewusste Datenbank oder Storage-Schicht voraus. Eine Anwendung, die für herkömmliche Blockgeräte entwickelt wurde, erhält ihn nicht automatisch.
ZNS zeigt den Trade-off: Mehr Wissen über das Medium kann die Effizienz verbessern, erhöht aber die Portabilitätskosten der Software.
Key Value, Simple Log Memory und Computational Programs erweitern das Namespace-Konzept
Spezialisierte Command Sets erlauben Keys/Values, einfache Logs oder die Ausführung von Programmen in der Nähe des Speichers. Sie sollen Übersetzungen und Datenbewegungen reduzieren.
Ihre Nutzung hängt von Controllern, Treibern, Bibliotheken und Anwendungen ab. In der Spezifikation zu stehen, macht sie nicht universell.
Je mehr Optionen es gibt, desto wichtiger sind Capability Discovery und ein Fallback. Modularität schafft Flexibilität und eine neue kommerzielle Matrix.
Compliance liefert Evidenz, keine End-to-End-Leistungszertifizierung
Interoperabilitätsprogramme und -workshops testen konkretes Verhalten zwischen Host und Controller. Sie decken Abweichungen auf, die der Text nicht offenbart.
Eine Liste misst keine Latenz, Endurance, Recovery oder Security über jede Topologie. Optionen und Treiber-Firmware-Matrizen ändern sich.
Der Käufer sollte Compliance als Basis nutzen und eigene Workloads, Ausfälle und Upgrades testen.
Disaggregation trennt Kapazität vom Server und verteilt Verantwortung neu
Lokaler Speicher verband Device, Host und Systemteam. Ein entfernter Pool kann viele Verbraucher bedienen und Zuweisungen per Software ändern.
Jetzt teilen sich Netz-, Storage-, Plattform-, Security- und Anwendungsteams Vorfälle. Eine Fabric-Verschlechterung kann wie ein Datenbankproblem wirken; Firmware wie ein Netzverlust.
Die Wirtschaftlichkeit hängt von Auslastung und operativer Kapazität ab, nicht nur vom Preis pro Terabyte.
KI macht Storage-Latenz zu Compute-Kosten
Training und Inferenz laden Datensätze, schreiben Checkpoints und bewegen Zustand in großem Maßstab. Wenn Tausende von Beschleunigern warten, wird Speicherverschwendung zu erheblichen Kosten.
TCP, RDMA, Multipath und gemeinsame Namespaces bieten Optionen, müssen aber mit Congestion, Recovery, Metadaten und Queue-Verhalten bewertet werden.
Das Ziel ist nicht nur Spitzendurchsatz, sondern vorhersagbare Queue-Latenz und Erholung bei synchronisierten Lasten.
NVMe 2.4 zeigt Breite und Versionsdruck
Das Bündel koordiniert Base, Transports, Boot, Management Interface und Command Sets. NVMe ist bereits ein Stack, kein SSD-Anschluss.
Ein Host kann Base 2.4 unterstützen, ohne jedes Command Set zu beherrschen; ein TCP-Controller kann sich von einem RDMA-Controller unterscheiden. Support-Angaben brauchen Details.
Treiber, Betriebssystem, Firmware, Transport und Management-Tool bilden eine Matrix, die in der Praxis Teil des Protokolls ist.
NVMe machte Speicher komposabel, ohne ihn einfach zu machen
Der Vertrag senkt eine Umstellungskosten: Befehle und Namespaces können den Wechsel von PCIe zu Fabric oder von einem Anbieter zu einem anderen überleben. Übrig bleiben Datenmigration, Sicherheit, Observability, Netz und Support.
Der Vorteil liegt in der Trennung von Protokoll und Produkt. Das Risiko besteht darin, sehr unterschiedliche Architekturen unter derselben Marke NVMe zu verstecken.
Speicher wird programmierbar und verteilbar, bleibt aber ein Integritätssystem, das im Fehlerfall verstanden werden muss.
Mitgliederbriefing
Detaillierter Profilkontext
Melden Sie sich mit der richtigen Mitgliedschaftsstufe an, um das vollständige Briefing und die Quellennotizen freizuschalten.
Nur für Strategic Circle
Strategic Circle
Offen für alle Leser. Schalten Sie Profil-Briefings nach Beitritt und Anmeldung frei.
Strategic Circle beitretenNur für Leadership Alliance
Leadership Alliance
Für qualifizierte Inhaber von IP-Assets und Management; melden Sie sich an, um Leadership-Alliance-Briefings freizuschalten.
Leadership Alliance beitreten
