Zusammenfassung
- NVM Express, Inc. ist das gemeinnützige Industriekonsortium, das die NVMe-Spezifikationsfamilie betreut; es stellt weder SSDs noch Controller noch Speichersysteme her.
- NVMe hat die von mechanischen Festplatten geerbten Annahmen serieller Warteschlangen durch zahlreiche In-Memory-Submission- und -Completion-Queues ersetzt, die auf Multicore-Prozessoren und die Parallelität von Flash ausgelegt sind.
- Dasselbe Modell aus Controller, Subsystem und Namespace kann lokal über PCIe oder entfernt über NVMe over Fabrics betrieben werden, mit TCP- und RDMA-Transporten zu unterschiedlichen Kosten.
- Die NVMe-2.x-Familie ist modular. Das 2.4-Paket, das am 4. August 2026 nach erfolgter Ratifizierung veröffentlicht wurde, umfasst die Base, die PCIe-/RDMA-/TCP-Transporte, NVMe-MI, Boot und mehrere spezialisierte Command Sets.
- Das Protokoll macht Kapazität und Zugriff komponierbarer. Es definiert weder Dateisystem, Haltbarkeit, RAID, Erasure Coding, Netz, operative Sicherheit noch Anwendungskonsistenz.
Ein Speicherbefehl kann den Server verlassen, ohne die grundlegende Sprache zu wechseln
Eine Anwendung kann einen Lese- oder Schreibvorgang an einen lokalen, über PCIe angebundenen NVMe-Namespace ausgeben. In einer Fabric-Architektur kann dasselbe Befehlsmodell ein entferntes Subsystem über Ethernet oder ein RDMA-Netz erreichen. Das Medium, der Controller und der Pfad ändern sich; die Grammatik des Speichers bleibt weitgehend dieselbe.
Diese Kontinuität ist die Grundlage der Disaggregation. Betreiber können Kapazität in gemeinsamen Systemen bündeln und sie bei Bedarf an Hosts anhängen, statt jedes Gerät in das Gehäuse zu stecken, das es nutzt.
Die Verlagerung beseitigt keine Abhängigkeit. Sie fügt Discovery, Netz, Multipath, Authentifizierung, Wiederverbindung und Ausfallbereiche hinzu. NVMe macht Speicher zu einem komponierbaren Dienst, nicht zu einer Ressource ohne Topologie.
Flash brauchte ein für Parallelität entwickeltes Protokoll
Die von Festplatten geerbten Protokolle waren von mechanischer Latenz und schmaleren Warteschlangen geprägt. Flash kann viele Operationen parallel verarbeiten, während moderne Server viele Kerne besitzen.
NVMe verwendet Paare aus Submission- und Completion-Queues im Speicher. Anwendungen oder Treiber platzieren Befehle, informieren den Controller über Doorbells und holen Abschlüsse per Interrupt oder Polling ab. Diese Struktur reduziert gemeinsame Sperren und erlaubt es, die Warteschlangen näher an die Kerne zu bringen, die sie nutzen.
Der Nutzen ist nicht automatisch. Firmware, PCIe-Topologie, NUMA-Speicher, Queue-Tiefe, Interrupts und Workload bestimmen die tatsächliche Latenz und den tatsächlichen Durchsatz.
Das Konsortium trennt die Governance des Protokolls vom Wettbewerb zwischen Produkten
Die NVMe-Arbeit begann Ende der 2000er-Jahre; Version 1.0 erschien 2011, und NVM Express, Inc. wurde 2014 gegründet. Das Konsortium vereint Hersteller von Plattformen, Prozessoren, Controllern, Speichermedien, Netzwerken und Systemen.
Zum Zeitpunkt der Recherche waren Amber Huffman von Google Präsidentin, Curtis Ballard von AMD Schatzmeister und David Allen von Microchip Sekretär. Dreizehn Vertreter der fördernden Mitglieder gehörten dem öffentlichen Vorstand an.
Das Konsortium definiert die Verträge und Konformitätsprogramme. Die Mitglieder konkurrieren weiterhin bei Silizium, Firmware, System, Support und Leistung. Die Teilnahme gewährt Zugang zum Prozess; sie beweist nicht, dass ein Produkt jede Funktion implementiert.
NVMe 2.0 machte aus einem wachsenden Dokument eine modulare Familie
Als sich das Protokoll auf mehrere Transporte und Datenmodelle ausdehnte, wurde ein einzelnes Dokument schwer zu pflegen. Die Umstrukturierung 2.0 von 2021 trennte Base, Command Sets und Transporte.
Diese Architektur erlaubt es einem TCP-Transport, sich weiterzuentwickeln, ohne das gesamte Command Set neu zu schreiben, und Zoned Namespaces voranzukommen, ohne jeden konventionellen Controller zu ändern. Sie zwingt die Käufer allerdings, mehrere Versionen zu verfolgen.
Das NVMe-2.4-Paket, das am 4. August 2026 veröffentlicht wurde, umfasste Base 2.4, PCIe Transport 1.4, RDMA Transport 1.3, TCP Transport 1.3, NVMe-MI 2.2, Boot 1.4 sowie die Command Sets NVM, Key Value, Zoned Namespace, Computational Programs und Simple Log Memory. „NVMe 2.4“ bezeichnet also eine koordinierte Sammlung, keine einzelne Datei.
Submission- und Completion-Queues bringen die Arbeit näher an die CPU
Eine Submission Queue enthält Befehle, die vom Host geschrieben wurden; die Completion Queue empfängt die Ergebnisse vom Controller. Mehrere Paare können Kernen oder Anwendungen zugeordnet werden, was die Contention reduziert.
Doorbells signalisieren neue Einträge. Der Controller kann Interrupts erzeugen, oder der Host kann pollen. Polling reduziert die Latenz manchmal auf Kosten eines höheren CPU-Verbrauchs. Interrupt-Coalescing senkt die Kosten, kann aber eine Verzögerung hinzufügen.
Die Queue-Tiefe ist keine universelle Leistungskennzahl. Zu tiefe Warteschlangen erhöhen Wartezeit und Queue-Latenz. Zu kurze Warteschlangen können das Gerät unterauslasten. Der Betrieb muss je nach Workload entscheiden.
Controller, Subsysteme und Namespaces trennen logischen Endpunkt und Medium
Ein Controller stellt Queues und Befehle bereit. Ein Subsystem kann mehrere Controller enthalten. Namespaces repräsentieren logische Speicherbereiche, die geteilt, vergrößert oder über mehrere Pfade erreichbar sein können.
Diese Abstraktion verhindert, eine physische SSD mit der Identität zu verwechseln, die der Host sieht. Ein entferntes Subsystem kann viele Speichermedien aggregieren und stabile Namespaces präsentieren.
Das Protokoll entscheidet nicht darüber, wie Daten platziert, repliziert oder geschützt werden. RAID, Erasure Coding, Thin Provisioning und Konsistenz bleiben Funktionen des Systems, das NVMe umgibt.
Administrative Befehle sind ebenso wichtig wie Ein-/Ausgabeoperationen
Eine Admin-Queue verwaltet Identifikation, Queue-Erstellung, Features, Logs, Firmware, Namespaces und Sicherheit. Diese Befehle steuern die Umgebung, in der gewöhnliche Lese- und Schreibvorgänge möglich werden.
Ein administrativer Fehler kann einen Namespace löschen, eine falsche Firmware aktivieren oder eine Energiekonfiguration ändern. Berechtigungen, Audits und Änderungsfenster sind daher entscheidend.
Die Trennung von Admin und I/O erleichtert die Architektur, macht den Kontrollpfad aber nicht weniger kritisch. In einer Fabric laufen diese Befehle manchmal über dasselbe Netz wie die Daten.
PCIe hält den lokalen Pfad nahe an Speicher und Hardware
NVMe over PCIe nutzt gemeinsame Speicherstrukturen und Controller-Register auf dem lokalen Bus. Es bietet einen direkten Pfad, der für im Server installierte SSDs und Karten geeignet ist.
Die physische Nähe garantiert keine einfache Topologie. Ein Gerät kann hinter einem PCIe-Switch, auf einem anderen NUMA-Socket liegen oder Lanes teilen. Die Platzierung von Prozess, Speicher und Gerät beeinflusst die Leistung.
Systeme müssen daher den PCIe-Pfad erfassen, nicht nur die Laufwerke zählen. Eine unerwartete Latenz kann aus der Server-Topologie stammen, bevor das Medium überhaupt erreicht wird.
NVMe over Fabrics verwandelt eine lokale Beziehung in einen Netzwerkdienst
NVMe-oF, dessen erste Version im Juni 2016 zusammen mit NVMe-MI 1.0 erschien, transportiert Befehlskapseln und Daten zu einem entfernten Subsystem. Der Host richtet Queues über eine Fabric ein und sieht Namespaces im Netz.
Die Trennung erlaubt es, Kapazität und Leistung zu teilen. Hosts können ausgetauscht werden, ohne Daten zu verschieben, und Systeme können mehreren Clustern Ressourcen bereitstellen.
Sie schafft neue Ausfallpunkte: NIC, Switch, Route, Discovery, Controller, Authentifizierung und Multipath-Richtlinie. Speicher wird vom Netz abhängig wie von einer Datenkomponente, nicht nur von Konnektivität.
Discovery-Controller machen Fabrics dynamisch und bündeln eine kritische Funktion
Ein Host kann einen Discovery-Controller abfragen, um die verfügbaren Subsysteme und Adressen zu erhalten. Das vermeidet die manuelle Konfiguration jedes Pfads und erlaubt es, Dienste hinzuzufügen oder zu entfernen.
Die Discovery kann jedoch zu einer zentralen Abhängigkeit werden. Ein fehlerhafter Eintrag kann den Host zum falschen Target führen oder eine Verbindung verhindern. Caches, Redundanz, Validierung und Identitätsschutz sind notwendig.
Der Discovery-Dienst darf nicht mit der Verfügbarkeit des Speichers selbst verwechselt werden. Ein bereits verbundener Host kann weiterarbeiten, während ein neuer Host den Dienst nicht entdeckt.
NVMe/TCP machte die Fabric über gewöhnliche IP-Netze zugänglich
Der 2019 standardisierte TCP-Transport bildet NVMe-Befehle und -Daten auf TCP-Verbindungen ab. Betreiber können geroutetes Ethernet, IP-Werkzeuge, Firewalls und vertraute Netzwerkpraktiken nutzen, ohne eine RDMA-Fabric aufzubauen.
Diese Zugänglichkeit hat ihren Preis. Der TCP-Stack, Kopien, Interrupts und die CPU können Overhead und Tail-Latenz hinzufügen. Kernel-Optimierungen, Offload und Transfergrößen beeinflussen das Ergebnis stark.
Der Transport fügt außerdem spezifische Framing- und Digest-Prüfungen hinzu, um Datenkorruption zu erkennen. TLS kann die Sitzung schützen, wenn Implementierung und Richtlinie dies vorsehen.
NVMe/RDMA zielt auf niedrige Latenz um den Preis von Fabric-Disziplin
RDMA erlaubt es, Befehle und Daten mit weniger CPU-Eingriff zu bewegen, und nutzt Queue-Paare, Speicherregistrierung und NIC-Fähigkeiten. Es eignet sich für Umgebungen, in denen Mikrosekunden und CPU-Zyklen zählen.
RDMA ist keine einzelne Fabric. RoCE, iWARP und andere Bindings haben unterschiedliche Verhaltensweisen und Anforderungen. Überlastung, Verluste, PFC oder ECN, die NIC-Konfiguration und der registrierte Speicher müssen verstanden werden.
Ein Benchmark mit niedriger Latenz beweist nicht, dass der Betrieb einfach sein wird. Fabric-Fehler können sich als Speicher-Timeouts äußern und erfordern Fähigkeiten, die Netz- und Systemtechnik verbinden.
Multipath macht Redundanz zu einer Entscheidung des Hosts
Ein Namespace kann über mehrere Controller und Pfade erreichbar sein. Das Host-System wählt, wie es lastverteilt oder umschaltet. Asymmetric Namespace Access zeigt an, welche Pfade optimiert, nicht optimiert oder nicht verfügbar sind.
Das Vorhandensein zweier Links garantiert keine Unabhängigkeit. Sie können sich Switch, Stromversorgung, Controller oder Route teilen. Betreiber müssen den Ausfall jedes Elements testen und die Reaktion des Host-Multipath prüfen.
Eine schlechte Richtlinie kann Verkehr auf einen langsamen Pfad schicken oder eine ausgefallene Route zu lange halten. Redundanz muss als Verhalten beobachtet werden, nicht als Zahl erfasst werden.
Reservierungen koordinieren den gemeinsamen Zugriff, ohne Cluster-Konsens zu ersetzen
Mit NVMe-Reservierungen können sich Hosts registrieren und einen Namespace reservieren, um nicht autorisierte parallele Schreibvorgänge zu verhindern. Sie sind in Clustern und Failover-Szenarien nützlich.
Sie ersetzen weder ein Konsensprotokoll noch die Anwendungskonsistenz. Ein ausgefallener Host kann einen zu bereinigenden Reservierungszustand hinterlassen, und die Wiederaufnahme muss verhindern, dass ein alter Knoten weiterschreibt.
Die Wiederherstellung erfordert Fencing sowie Generations- und Identitätsprüfungen. Eine schlecht verwaltete Reservierung kann eine Schutzmaßnahme in Nichtverfügbarkeit verwandeln.
Authentifizierung und TLS werden notwendig, wenn der Speicher PCIe verlässt
Ein lokales Gerät profitierte oft von einer impliziten physischen Grenze. In einer Fabric müssen Initiator und Target ihre Identität nachweisen und die geeigneten Kanäle schützen.
NVMe definiert Authentifizierungsmechanismen, und NVMe/TCP kann TLS verwenden. Deren Wert hängt von Schlüsseln, Zertifikaten, Erneuerungen, Algorithmen und Zugriffsrichtlinien ab. Ein Transport, der TLS unterstützt, ist nicht notwendigerweise für dessen Nutzung konfiguriert.
Die Discovery-Ebene, die Verwaltungsebene und die Datenebene müssen gemeinsam betrachtet werden. Eine korrekt authentifizierte Identität kann dennoch über zu weitreichende Rechte verfügen.
NVMe-MI bietet einen Verwaltungspfad getrennt von den Anwendungs-I/Os
Die NVMe Management Interface erlaubt es Werkzeugen, Subsysteme zu entdecken und zu verwalten, den Gesundheitszustand zu lesen, Geräte zu erfassen und bestimmte Operationen auszuführen, selbst wenn der Haupt-I/O-Pfad nicht genutzt wird.
Diese Trennung hilft bei Wartung und Wiederherstellung. Sie fügt aber auch eine zweite zu sichernde Kontrollebene hinzu. Ein Verwaltungswerkzeug kann sensible Daten lesen oder Komponenten in großem Umfang verändern.
NVMe-MI lässt sich in Redfish-Systeme und andere Verwaltungsmodelle integrieren. Die Integration beseitigt die Verantwortungsgrenzen zwischen Konsortien und Anbietern nicht.
Zoned Namespaces legen die Beschränkungen des Mediums gegenüber dem Host offen
ZNS teilt die Kapazität in Zonen, die sequenziell beschrieben werden. Indem der Software Sichtbarkeit auf die Organisation des Mediums gegeben wird, lassen sich einige interne Arbeiten der Garbage Collection reduzieren und Ausdauer oder Vorhersagbarkeit verbessern.
Der Vorteil setzt voraus, dass Dateisystem, Datenbank oder Speicherschicht die Zonen verstehen. Eine Anwendung, die für ein herkömmliches Blockgerät entwickelt wurde, profitiert nicht automatisch von dem Modell.
ZNS veranschaulicht die Spannung bei NVMe: Mehr Verhalten offenzulegen kann die Effizienz verbessern, erhöht aber die Portabilitätsanforderungen an die Software.
Key Value, Simple Log Memory und Computational Programs erweitern den Namespace
Die spezialisierten Command Sets ermöglichen den Zugriff auf Schlüssel-Wert-Paare, einen einfachen Journal-Speicher oder Rechenprogramme, die nahe am Speicher ausgeführt werden. Sie sollen für bestimmte Workloads Übersetzungen und Datenbewegungen reduzieren.
Ihre Einführung hängt von Controllern, Treibern, Bibliotheken und Anwendungen ab. Ein Command Set in der Spezifikation ist keine universelle Funktion aller SSDs oder Speichersysteme.
Je mehr Modelle das Protokoll bietet, desto präziser muss die Software Fähigkeiten erkennen und über einen Ausweichpfad verfügen. Die technische Modularität schafft eine neue kommerzielle Matrix.
Konformität liefert einen nützlichen Nachweis, ohne die Ende-zu-Ende-Leistung zu zertifizieren
Die Interoperabilitätsprogramme und -workshops prüfen präzise Verhaltensweisen zwischen Hosts und Controllern. Sie decken Abweichungen auf, die das Lesen der Spezifikation nicht offenbart.
Eine Konformitätsliste misst Latenz, Ausdauer, Wiederherstellung oder Sicherheit nicht in jeder Topologie. Optionale Funktionen können sich unterscheiden, und die Treiber-Firmware-Matrix entwickelt sich weiter.
Käufer sollten Konformität als Mindeststandard behandeln und ihre Workload, ihre Ausfälle und ihren Upgrade-Zyklus testen.
NVMe hat die Kapazität vom Server getrennt und die Verantwortung verlagert
Lokaler Speicher verband oft Gerät, Host und Systemteam. Die Disaggregation erlaubt es, einen Pool zwischen vielen Konsumenten zu teilen und die Zuteilung per Software zu ändern.
Sie bringt Netz-, Speicher-, Plattform-, Sicherheits- und Anwendungsteams in denselben Vorfall. Eine Verschlechterung der Fabric kann wie ein Datenbankproblem erscheinen; eine Controller-Firmware kann wie ein Netzverlust wirken.
Der wirtschaftliche Gewinn hängt daher von der Nutzung der Kapazität und der Betriebsfähigkeit ab, nicht nur vom Preis pro Terabyte.
KI macht die Speicherlatenz als Rechenkosten sichtbar
Trainingsläufe schreiben Checkpoints, laden Datensätze und verschieben Zustände in großem Maßstab. Wenn Tausende von Beschleunigern warten, kann eine Speicherschwankung erhebliche Recheninvestitionen verschwenden.
NVMe/TCP, RDMA, Multipath und gemeinsame Namespaces bieten mehrere mögliche Architekturen. Die Wahl muss Überlastung, Topologie, Durchsatz, Metadaten, Recovery und Queue-Verhalten berücksichtigen.
Das Ziel ist nicht nur ein maximaler Benchmark, sondern eine vorhersehbare Queue- und Wiederaufnahme-Latenz während synchronisierter Operationen.
Das 2.4-Paket zeigt zugleich Umfang und Versionsdruck
NVMe 2.4 koordiniert Base, Transporte, Boot, Management Interface und spezialisierte Command Sets. Diese Breite zeigt, dass NVMe zu einem Stack geworden ist, nicht nur zu einem Anschluss für SSDs.
Sie erschwert Support-Aussagen. Ein Host kann Base 2.4 unterstützen, ohne jedes Command Set oder jede Sicherheitsfunktion zu unterstützen. Ein Controller kann TCP bieten, ohne dieselben Fähigkeiten wie ein RDMA-Produkt zu besitzen.
Die Nachverfolgung muss Treiber-, Firmware-, OS-, Transport- und Verwaltungswerkzeug-Versionen umfassen. In der Praxis gehört diese Matrix zum Protokoll.
NVMe hat Speicher komponierbar gemacht, ohne den Dienst einfach zu machen
Das gemeinsame Protokoll senkt eine Art von Wechselkosten: Das Befehlsmodell kann den Wechsel von PCIe zu einer Fabric oder von einem Anbieter zu einem anderen überstehen. Andere Kosten bleiben: Datenmigration, Namespace-Identität, Sicherheitsrichtlinie, Netz, Beobachtbarkeit und Support.
Der strategische Vorteil ist eine klarere Trennung zwischen Protokoll und Produkt. Das Risiko besteht darin, eine komplexe Architektur hinter demselben Namen NVMe zu verbergen.
Speicher wird programmierbar und verteilbar. Er hört nicht auf, ein Integritätssystem zu sein, dessen jede Schicht im Fehlerfall verstanden werden muss.
Mitgliederbriefing
Detaillierter Profilkontext
Melden Sie sich mit der richtigen Mitgliedschaftsstufe an, um das vollständige Briefing und die Quellennotizen freizuschalten.
Nur für Strategic Circle
Strategic Circle
Offen für alle Leser. Schalten Sie Profil-Briefings nach Beitritt und Anmeldung frei.
Strategic Circle beitretenNur für Leadership Alliance
Leadership Alliance
Für qualifizierte Inhaber von IP-Assets und Management; melden Sie sich an, um Leadership-Alliance-Briefings freizuschalten.
Leadership Alliance beitreten
