Zusammenfassung

  • NVM Express, Inc. ist das gemeinnützige Industriekonsortium hinter der NVMe-Spezifikationsfamilie. Es produziert keine SSDs, Controller, Switches oder Storage-Systeme.
  • NVMe ersetzte serielle Annahmen aus der Festplattenära durch viele Submission und Completion Queues im Speicher, passend zu parallelem Flash und Multicore-CPUs.
  • Dasselbe Modell aus Controller, Subsystem und Namespace funktioniert lokal über PCIe oder entfernt über NVMe over Fabrics; TCP und RDMA bringen unterschiedliche Betriebsprofile.
  • NVMe 2.x ist modular. Das am 4. August 2026 veröffentlichte 2.4-Set koordiniert Base, PCIe/RDMA/TCP-Transporte, NVMe-MI, Boot und mehrere spezialisierte Command Sets.
  • Das Protokoll macht Kapazität komponierbarer, definiert aber weder Dateisystem, Haltbarkeit, RAID, Erasure Coding, Netzwerkdesign, Betriebssicherheit noch Anwendungskonsistenz.

Ein Storage-Befehl kann den Server verlassen, ohne seine Grundsprache zu wechseln

Eine Anwendung liest aus einem lokalen PCIe-Namespace oder aus einem entfernten Subsystem über ein Fabric. Medium, Controller und Pfad ändern sich, das Befehlsmodell bleibt weitgehend gleich.

Diese Kontinuität ermöglicht Disaggregation. Kapazität kann gepoolt und Hosts nach Bedarf zugewiesen werden, statt jedes Gerät in den konsumierenden Server einzubauen.

Hinzu kommen Discovery, Netzwerk, Multipath, Authentisierung, Reconnect und neue Fehlerdomänen. NVMe macht Speicher zum programmierbaren Dienst, nicht zu einer topologielosen Ressource.

Flash brauchte ein Protokoll für Parallelität statt mechanische Latenz

Ältere Schnittstellen spiegelten Festplatten und schmale Queues wider. Flash kann viele Operationen parallel bearbeiten, während Server zahlreiche CPU-Kerne besitzen.

NVMe nutzt Paare aus Submission und Completion Queues im Speicher. Der Host schreibt Commands, betätigt Doorbells und erhält Completions per Interrupt oder Polling. Mehrere Queues verringern gemeinsame Locks und lassen sich Kernen zuordnen.

Die Leistung hängt dennoch von Firmware, PCIe-Topologie, NUMA, Queue Depth, Interrupts und Workload ab. Der Protokollname garantiert keine universelle Latenz.

Das Konsortium trennt Protokoll-Governance vom Produktwettbewerb

Die Arbeit begann Ende der 2000er Jahre; NVMe 1.0 erschien 2011, NVM Express, Inc. wurde 2014 gegründet. Mitglieder kommen aus CPU-, Medien-, Controller-, Netzwerk-, Cloud- und Systemmärkten.

Zum Stichtag war Amber Huffman von Google President, Curtis Ballard von AMD Treasurer und David Allen von Microchip Secretary. Das öffentliche Board listete dreizehn Promoter-Vertreter.

Das Konsortium definiert Verträge und Compliance. Mitglieder konkurrieren weiter bei Silizium, Firmware, Systemen, Support und Leistung. Mitgliedschaft beweist keine vollständige Implementierung.

NVMe 2.0 zerlegte ein wachsendes Dokument in eine modulare Familie

Mehrere Transporte und Datenmodelle machten ein einziges Dokument unhandlich. Die 2.0-Neustrukturierung von 2021 trennte Base, Command Sets und Transports.

TCP kann so weiterentwickelt werden, ohne jeden Befehl neu zu schreiben; ZNS kann wachsen, ohne jeden Standardcontroller zu ändern. Dafür entsteht eine komplexere Versionsmatrix.

Das 2.4-Set vom 4. August 2026 umfasste Base 2.4, PCIe 1.4, RDMA 1.3, TCP 1.3, NVMe-MI 2.2, Boot 1.4 sowie NVM-, Key-Value-, Zoned-Namespace-, Computational-Programs- und Simple-Log-Memory-Command-Sets. „NVMe 2.4“ ist kein einzelnes Dokument.

Submission und Completion Queues bringen Arbeit näher an CPU-Kerne

Der Host schreibt Commands in Submission Queues; der Controller meldet Ergebnisse in Completion Queues. Prozesse oder Kerne können eigene Paare nutzen und Contention reduzieren.

Doorbells melden neue Arbeit. Polling kann Latenz senken und CPU binden; Interrupt Coalescing spart Zyklen und kann Wartezeit erhöhen. Queue Depth beeinflusst Auslastung und Tail Latency.

Eine tiefere Queue ist nicht automatisch besser. Sie kann Sättigung verbergen und Wartezeit erhöhen. Die richtige Einstellung folgt dem Workload.

Controller, Subsysteme und Namespaces trennen logische Endpunkte vom Medium

Ein Controller stellt Queues und Commands bereit. Ein Subsystem kann mehrere Controller enthalten. Namespaces repräsentieren logische Kapazität und können über mehrere Pfade erreichbar sein.

Die Host-Identität entspricht damit nicht zwingend einer physischen SSD. Ein Array kann viele Medien bündeln und stabile Namespaces präsentieren.

NVMe bestimmt weder Datenplatzierung noch Replikation oder Schutz. RAID, Erasure Coding, Thin Provisioning und Konsistenz liegen im umgebenden System.

Administrative Befehle bestimmen die Umgebung der I/O

Die Admin Queue verwaltet Identifikation, Queue-Erstellung, Features, Logs, Firmware, Namespaces und Security. Sie schafft den Kontext für normale Reads und Writes.

Ein Admin-Befehl kann einen Namespace löschen, falsche Firmware aktivieren oder einen Power State ändern. Rechte, Audit und Change Control sind entscheidend.

Die Trennung von Admin und I/O verbessert die Architektur, macht die Control Plane aber nicht weniger kritisch. Im Fabric können beide vom gleichen Netzwerk abhängen.

PCIe hält den lokalen Pfad nahe an Speicher und Hardware

NVMe über PCIe nutzt gemeinsame Speicherstrukturen und Controller-Register auf dem lokalen Bus. Das ist der direkte Weg zu SSDs und Karten im Server.

Die Topologie bleibt wichtig. Ein Gerät kann hinter einem PCIe-Switch, an einem anderen NUMA-Socket oder auf geteilten Lanes liegen. CPU, Speicher und Device müssen sinnvoll platziert sein.

Die Zahl der Drives reicht als Inventar nicht aus. Latenz kann schon im Host entstehen, bevor das Medium erreicht wird.

NVMe over Fabrics macht aus einer lokalen Beziehung einen Netzwerkdienst

NVMe-oF 1.0 und NVMe-MI 1.0 erschienen am 9. Juni 2016. NVMe-oF transportiert Capsules und Daten zu einem entfernten Subsystem und erzeugt Queues über das Fabric.

Kapazität kann gepoolt und von Compute getrennt werden. Hosts lassen sich austauschen, ohne die Daten zu verschieben.

Dafür kommen NIC, Switch, Route, Discovery, Controller, Authentisierung und Multipath in den Datenpfad. Das Netzwerk wird Teil des Datenintegritätssystems.

Discovery Controller vereinfachen Anbindung und schaffen eine kritische Abhängigkeit

Hosts fragen Discovery Controller nach Subsystemen, Adressen und Diensten. Manuelle Konfiguration jedes Targets wird überflüssig.

Falsche Information oder Ausfall kann neue Verbindungen blockieren oder zum falschen Ziel führen. Redundanz, Cache, Validierung und Identitätsschutz sind erforderlich.

Discovery und Datenverfügbarkeit sind nicht dasselbe. Bestehende Sessions können weiterlaufen, während neue Hosts nichts finden.

NVMe/TCP brachte Storage Fabrics auf gewöhnliche IP-Netze

Der 2019 standardisierte TCP-Transport bildet Commands und Daten auf TCP-Verbindungen ab. Betreiber können geroutetes Ethernet, IP-Werkzeuge und Firewalls nutzen, ohne ein RDMA-Fabric aufzubauen.

Die Zugänglichkeit kostet Overhead. TCP-Stack, Kopien, Interrupts und CPU beeinflussen Tail Latency. Kernel, Offload, Transfergröße und Tuning sind wichtig.

Der Transport ergänzt Framing und Digests und kann TLS verwenden. TLS-Unterstützung bedeutet nicht, dass TLS aktiviert oder korrekt betrieben wird.

NVMe/RDMA zielt auf geringe Latenz und verlangt Fabric-Disziplin

RDMA nutzt Queue Pairs, registrierten Speicher und NIC-Offload, um Daten mit weniger CPU-Eingriff zu bewegen. Das ist für HPC und KI attraktiv.

RDMA ist kein einheitliches Netz. RoCE, iWARP und andere Bindings haben unterschiedliche Anforderungen an Congestion, Loss, PFC, ECN und Memory Registration.

Ein schneller Benchmark beweist keinen einfachen Betrieb. Fabric-Probleme erscheinen als Storage Timeouts und erfordern Netzwerk- und Systemwissen.

Multipath macht Redundanz zur Host-Entscheidung

Ein Namespace kann über mehrere Controller und Pfade erreichbar sein. Der Host entscheidet über Lastverteilung und Failover. Asymmetric Namespace Access markiert optimierte, nicht optimierte oder nicht verfügbare Wege.

Zwei Links können Switch, Controller, Strom oder Route teilen. Unabhängigkeit muss durch echte Fehler getestet werden.

Eine falsche Policy hält einen schlechten Pfad zu lange oder sendet I/O über einen langsamen Weg. Redundanz ist beobachtetes Verhalten, nicht Portanzahl.

Reservations koordinieren gemeinsamen Zugriff, ersetzen aber keinen Konsens

NVMe Reservations lassen Hosts registrieren und einen Namespace reservieren, damit unberechtigte Schreiber blockiert werden. Sie helfen in Cluster- und Failover-Szenarien.

Sie ersetzen keinen Clusterkonsens und keine Anwendungskonsistenz. Ein ausgefallener Host kann Zustand hinterlassen; Fencing muss alte Knoten am Schreiben hindern.

Schlechte Recovery kann Schutz in Ausfall oder Korruption verwandeln.

Authentisierung und TLS werden wichtig, wenn Storage PCIe verlässt

Ein lokales Gerät profitierte von einer impliziten physischen Grenze. Im Netz müssen Initiator und Target Identitäten nachweisen und Kanäle schützen.

NVMe definiert Authentication; TCP kann TLS einsetzen. Das Ergebnis hängt von Schlüsseln, Zertifikaten, Rotation, Algorithmen und Policy ab. Unterstützung ist nicht gleich sichere Nutzung.

Discovery-, Admin- und Data Plane müssen zusammen betrachtet werden. Eine echte Identität kann immer noch zu viele Rechte besitzen.

NVMe-MI schafft eine Management Plane getrennt von Anwendungs-I/O

NVMe Management Interface erlaubt Inventar, Health-Abfrage und bestimmte Aktionen auch außerhalb des primären I/O-Pfads.

Das unterstützt Wartung und Recovery, fügt aber eine privilegierte Schnittstelle hinzu. Managementwerkzeuge können sensible Informationen lesen oder Geräte massenhaft verändern.

NVMe-MI kann mit Redfish integriert werden. Die Integration hebt Verantwortungsgrenzen zwischen Standards und Herstellern nicht auf.

Zoned Namespaces macht Medienbeschränkungen für Software sichtbar

ZNS teilt Kapazität in sequenziell beschreibbare Zonen. Sichtbarkeit für den Host kann interne Garbage Collection reduzieren und Ausdauer oder Vorhersagbarkeit verbessern.

Der Vorteil verlangt zone-aware Filesysteme, Datenbanken oder Storage Layer. Eine normale Block-Anwendung profitiert nicht automatisch.

ZNS zeigt den Tausch: Mehr Medieneinblick verbessert Effizienz und erhöht die Portabilitätsanforderung an Software.

Key Value, Simple Log Memory und Computational Programs erweitern den Namespace

Spezialisierte Command Sets ermöglichen Key/Value-Zugriff, einfache Log-Strukturen oder Programme nahe am Speicher. Sie sollen Übersetzungen und Datenbewegung verringern.

Die Nutzung hängt von Controllern, Treibern, Libraries und Anwendungen ab. Eine Spezifikation macht die Funktion nicht universell.

Je mehr Optionen, desto wichtiger sind Capability Discovery und Fallback. Modularität schafft Flexibilität und eine neue Markt-Matrix.

Compliance liefert Evidenz, zertifiziert aber keine End-to-End-Leistung

Programme und Workshops testen konkrete Host-Controller-Interaktionen und entdecken Abweichungen, die der Text allein nicht zeigt.

Eine Listung misst nicht Latenz, Ausdauer, Recovery oder Security in jeder Topologie. Optional Features und Driver-Firmware-Matrizen ändern sich.

Käufer sollten Compliance als Mindestboden nutzen und eigene Workloads, Fehler und Upgrades testen.

Disaggregation trennt Kapazität vom Host und verteilt Verantwortung neu

Lokaler Speicher verband Gerät, Server und Systemteam. Ein entfernter Pool bedient viele Verbraucher und wird per Software zugewiesen.

Netzwerk-, Storage-, Plattform-, Security- und Anwendungsteams teilen nun Vorfälle. Fabric-Degradation kann wie ein Datenbankfehler aussehen; Firmwareprobleme wie Netzverlust.

Die Wirtschaftlichkeit hängt von Auslastung und Betriebsfähigkeit ab, nicht nur vom Preis pro Terabyte.

KI macht Storage-Latenz zu Compute-Kosten

Training lädt Datensätze, schreibt Checkpoints und bewegt Zustand im großen Maßstab. Wenn Tausende Beschleuniger warten, wird Storage-Wartezeit teuer.

TCP, RDMA, Multipath und geteilte Namespaces bieten verschiedene Architekturen. Congestion, Recovery, Metadaten und Queue-Verhalten gehören in die Auswahl.

Ziel ist nicht nur Spitzendurchsatz, sondern vorhersehbare Queue- und Recovery-Latenz während synchronisierter Last.

NVMe 2.4 zeigt Breite und Versionsdruck

Das Set koordiniert Base, Transporte, Boot, Management Interface und Command Sets. NVMe ist ein Stack, kein bloßer SSD-Anschluss.

Ein Host kann Base 2.4 ohne jedes Command Set unterstützen; ein TCP-Controller kann andere Funktionen als ein RDMA-Produkt haben. Support-Aussagen müssen konkret sein.

Treiber, OS, Firmware, Transport und Managementtools bilden eine Matrix, die praktisch Teil des Protokolls ist.

NVMe machte Storage komponierbar, nicht einfach

Der gemeinsame Vertrag senkt einen Wechselkostenpunkt: Commands und Namespaces können einen Wechsel von PCIe zu Fabric oder von Anbieter zu Anbieter überstehen. Datenmigration, Security, Observability, Netzwerk und Support bleiben.

Der Vorteil ist die Trennung von Protokoll und Produkt. Das Risiko ist, sehr unterschiedliche Architekturen unter demselben Namen zu verbergen.

Storage wird programmierbar und verteilt, bleibt aber ein Integritätssystem, das unter Fehlern verstanden werden muss.