Resumen
- NVM Express, Inc. es el consorcio industrial sin ánimo de lucro que gobierna la familia de especificaciones NVMe; no fabrica SSD, controladores ni cabinas de almacenamiento.
- NVMe reemplazó los supuestos de colas serie heredados de los discos mecánicos por numerosas colas de envío y de finalización en memoria, adaptadas a los procesadores multinúcleo y al paralelismo de la memoria flash.
- El mismo modelo de controlador, subsistema y espacio de nombres puede funcionar localmente sobre PCIe o de forma remota mediante NVMe over Fabrics, con transportes TCP y RDMA de costes diferentes.
- La serie NVMe 2.x es modular. El conjunto 2.4, publicado el 4 de agosto de 2026 tras su ratificación, incluye la Base, los transportes PCIe/RDMA/TCP, NVMe-MI, Boot y varios conjuntos de comandos especializados.
- El protocolo hace que la capacidad y el acceso sean más componibles. No define el sistema de archivos, la durabilidad, RAID, el código de borrado, la red, la seguridad operativa ni la coherencia de la aplicación.
Un comando de almacenamiento puede salir del servidor sin cambiar de lenguaje fundamental
Una aplicación puede emitir una lectura o una escritura hacia un espacio de nombres NVMe local conectado por PCIe. En una arquitectura de fabric, el mismo modelo de comando puede alcanzar un subsistema remoto a través de Ethernet o de una red RDMA. El medio, el controlador y la ruta cambian; la gramática del almacenamiento sigue siendo en gran medida común.
Esta continuidad es la base de la desagregación. Los operadores pueden concentrar capacidad en sistemas compartidos y asignarla a los hosts bajo demanda, en lugar de colocar cada dispositivo en el chasis que lo utiliza.
El desplazamiento no elimina ninguna dependencia. Añade descubrimiento, red, multipath, autenticación, reconexión y dominios de fallo. NVMe transforma el almacenamiento en un servicio componible, no en un recurso sin topología.
La memoria flash necesitaba un protocolo diseñado para el paralelismo
Los protocolos heredados de los discos duros estaban condicionados por la latencia mecánica y colas más estrechas. La memoria flash puede procesar muchas operaciones en paralelo, mientras que los servidores modernos tienen muchos núcleos.
NVMe utiliza pares de colas de envío y colas de finalización en memoria. Las aplicaciones o los controladores colocan los comandos, informan al controlador mediante doorbells y recuperan las finalizaciones por interrupción o sondeo. Esta estructura reduce los bloqueos compartidos y permite acercar las colas a los núcleos que las utilizan.
El beneficio no es automático. El firmware, la topología PCIe, la memoria NUMA, la profundidad de cola, las interrupciones y la carga de trabajo determinan la latencia y el rendimiento reales.
El consorcio separa la gobernanza del protocolo de la competencia entre productos
El trabajo de NVMe comenzó a finales de la década de 2000; la versión 1.0 se publicó en 2011 y NVM Express, Inc. se constituyó en 2014. El consorcio reúne a fabricantes de plataformas, procesadores, controladores, medios, redes y sistemas.
En el umbral de la investigación, Amber Huffman de Google era presidenta, Curtis Ballard de AMD tesorero y David Allen de Microchip secretario. Trece representantes de los miembros promotores figuraban en el consejo público.
El consorcio define los contratos y programas de conformidad. Los miembros siguen compitiendo en silicio, firmware, sistema, soporte y rendimiento. La participación da acceso al proceso; no prueba que un producto implemente cada función.
NVMe 2.0 transformó un documento creciente en una familia modular
A medida que el protocolo se extendía a varios transportes y modelos de datos, un solo documento se volvía difícil de mantener. La reestructuración 2.0 de 2021 separó la Base, los conjuntos de comandos y los transportes.
Esta arquitectura permite que un transporte TCP evolucione sin reescribir todo el conjunto de comandos, o que Zoned Namespaces avance sin modificar cada controlador convencional. No obstante, obliga a los compradores a seguir varias versiones.
El conjunto NVMe 2.4, hecho público el 4 de agosto de 2026, agrupaba la Base 2.4, el Transporte PCIe 1.4, el Transporte RDMA 1.3, el Transporte TCP 1.3, NVMe-MI 2.2, Boot 1.4 y los conjuntos de comandos NVM, Key Value, Zoned Namespace, Computational Programs y Simple Log Memory. «NVMe 2.4» designa, por tanto, una colección coordinada, no un archivo único.
Las colas de envío y de finalización acercan el trabajo a la CPU
Una cola de envío contiene comandos escritos por el host; la cola de finalización recibe los resultados del controlador. Varios pares pueden asociarse a núcleos o aplicaciones, lo que reduce la contención.
Los doorbells señalan los nuevos elementos. El controlador puede generar interrupciones o el host puede realizar sondeo. El sondeo a veces reduce la latencia a costa de un mayor consumo de CPU. La coalescencia de interrupciones reduce el coste, pero puede añadir retardo.
La profundidad de cola no es una medida de rendimiento universal. Colas demasiado profundas aumentan la espera y la latencia de cola. Colas demasiado cortas pueden infrautilizar el dispositivo. La operación debe elegir según la carga de trabajo.
Los controladores, subsistemas y espacios de nombres separan el endpoint lógico del medio
Un controlador expone colas y comandos. Un subsistema puede contener varios controladores. Los espacios de nombres representan espacios de almacenamiento lógicos que pueden compartirse, redimensionarse o ser accesibles por varias rutas.
Esta abstracción evita confundir un SSD físico con la identidad que ve el host. Un subsistema remoto puede agregar muchos medios y presentar espacios de nombres estables.
El protocolo no decide cómo se colocan, replican o protegen los datos. RAID, el código de borrado, el aprovisionamiento fino y la coherencia siguen siendo funciones del sistema que rodea a NVMe.
Los comandos administrativos son tan importantes como las entradas y salidas
Una cola administrativa gestiona la identificación, la creación de colas, las características, los registros, el firmware, los espacios de nombres y la seguridad. Estos comandos controlan el entorno en el que las lecturas y escrituras ordinarias se vuelven posibles.
Un error administrativo puede eliminar un espacio de nombres, activar un firmware incorrecto o modificar una configuración de energía. Por tanto, los permisos, las auditorías y las ventanas de cambio son esenciales.
La separación admin/E/S facilita la arquitectura, pero no hace que el plano de control sea menos crítico. En un fabric, estos comandos a veces pasan por la misma red que los datos.
PCIe mantiene la ruta local cerca de la memoria y el hardware
NVMe over PCIe utiliza estructuras de memoria compartida y registros del controlador en el bus local. Ofrece una ruta directa adecuada para SSD y tarjetas instaladas en el servidor.
La proximidad física no garantiza una topología simple. Un dispositivo puede estar detrás de un conmutador PCIe, en otro zócalo NUMA o compartir líneas (lanes). La ubicación del proceso, la memoria y el dispositivo influye en el rendimiento.
Por tanto, los sistemas deben inventariar la ruta PCIe, no solo contar las unidades. Una latencia inesperada puede venir de la topología del servidor antes incluso de llegar al medio.
NVMe over Fabrics transforma una relación local en un servicio de red
NVMe-oF, cuya primera versión se publicó en junio de 2016 con NVMe-MI 1.0, transporta cápsulas de comandos y datos hacia un subsistema remoto. El host establece colas a través de un fabric y ve espacios de nombres de red.
La separación permite compartir capacidad y rendimiento. Los hosts pueden sustituirse sin mover los datos, y los sistemas pueden proporcionar recursos a varios clústeres.
Crea nuevos puntos de fallo: NIC, conmutador, ruta, descubrimiento, controlador, autenticación y política de multipath. El almacenamiento pasa a depender de la red como componente de datos, no solo de conectividad.
Los controladores de descubrimiento hacen dinámicos los fabrics y concentran una función crítica
Un host puede consultar a un controlador de descubrimiento para obtener los subsistemas y direcciones disponibles. Esto evita configurar manualmente cada ruta y permite añadir o retirar servicios.
Sin embargo, el descubrimiento puede convertirse en una dependencia central. Un dato erróneo puede dirigir al host al target equivocado o impedir una conexión. Son necesarios cachés, redundancia, validación y protección de la identidad.
El servicio de descubrimiento no debe confundirse con la disponibilidad del almacenamiento en sí. Un host ya conectado puede continuar, mientras que un host nuevo falla al descubrir el servicio.
NVMe/TCP hizo accesible el fabric en redes IP ordinarias
El transporte TCP, normalizado en 2019, mapea comandos y datos NVMe sobre conexiones TCP. Los operadores pueden utilizar Ethernet enrutado, herramientas IP, cortafuegos y prácticas de red conocidas sin construir un fabric RDMA.
Esta accesibilidad tiene un coste. La pila TCP, las copias, las interrupciones y la CPU pueden añadir sobrecarga (overhead) y latencia de cola (tail latency). Las optimizaciones del kernel, la descarga (offload) y el tamaño de las transferencias influyen mucho en el resultado.
El transporte añade además controles específicos de framing y digest para detectar corrupciones. TLS puede proteger la sesión cuando la implementación y la política lo prevén.
NVMe/RDMA busca una baja latencia a costa de una disciplina de fabric
RDMA permite mover comandos y datos con menos intervención de la CPU y utilizar pares de colas (queue pairs), registro de memoria y capacidades de NIC. Es adecuado para entornos donde importan los microsegundos y los ciclos de CPU.
RDMA no es un fabric único. RoCE, iWARP y otros bindings tienen comportamientos y requisitos diferentes. Deben comprenderse la congestión, las pérdidas, el PFC o ECN, la configuración de las NIC y la memoria registrada.
Un benchmark de baja latencia no demuestra que la operación será sencilla. Los errores del fabric pueden manifestarse como timeouts de almacenamiento y exigir competencias transversales de red y sistema.
Multipath convierte la redundancia en una decisión del host
Un espacio de nombres puede ser accesible a través de varios controladores y rutas. El sistema host decide cómo equilibrar o conmutar. Asymmetric Namespace Access indica qué rutas están optimizadas, no optimizadas o no disponibles.
La presencia de dos enlaces no garantiza la independencia. Pueden compartir conmutador, alimentación, controlador o ruta. Los operadores deben probar la pérdida de cada elemento y verificar la reacción del host multipath.
Una mala política puede enviar tráfico por una ruta lenta o mantener una ruta con fallos demasiado tiempo. La redundancia debe observarse como comportamiento, no inventariarse como número.
Las reservas coordinan el acceso compartido sin sustituir el consenso del clúster
Las reservas NVMe permiten a los hosts registrarse y reservar un espacio de nombres para evitar escrituras concurrentes no autorizadas. Son útiles en clústeres y escenarios de conmutación por error (failover).
No sustituyen a un protocolo de consenso ni a la coherencia de la aplicación. Un host con fallos puede dejar un estado de reserva que debe limpiarse, y la recuperación debe evitar que un nodo antiguo siga escribiendo.
La recuperación requiere fencing, generación y verificación de la identidad. Una reserva mal gestionada puede convertir una medida de protección en una indisponibilidad.
La autenticación y TLS se vuelven necesarios cuando el almacenamiento sale de PCIe
Un dispositivo local solía tener una frontera física implícita. En un fabric, un iniciador y un target deben demostrar su identidad y proteger los canales adecuados.
NVMe define mecanismos de autenticación, y NVMe/TCP puede utilizar TLS. Su valor depende de las claves, certificados, renovaciones, algoritmos y políticas de acceso. Un transporte que soporta TLS no está necesariamente configurado para usarlo.
El plano de descubrimiento, el plano administrativo y el plano de datos deben considerarse en conjunto. Una identidad correctamente autenticada puede seguir teniendo permisos demasiado amplios.
NVMe-MI ofrece una vía de gestión separada de las E/S de aplicación
NVMe Management Interface permite a las herramientas descubrir y gestionar subsistemas, leer el estado de salud, inventariar dispositivos y realizar ciertas operaciones incluso cuando la vía de E/S principal no se utiliza.
Esta separación ayuda al mantenimiento y la recuperación. También añade un segundo plano de control que debe protegerse. Una herramienta de gestión puede leer datos sensibles o modificar componentes a gran escala.
NVMe-MI puede integrarse con los sistemas Redfish y otros modelos de gestión. La integración no elimina las fronteras de responsabilidad entre consorcios y proveedores.
Zoned Namespaces expone las restricciones del medio al host
ZNS divide la capacidad en zonas que se escriben de forma secuencial. Al dar al software visibilidad sobre la organización del medio, puede reducir parte del trabajo interno de recolección de basura y mejorar la resistencia o la previsibilidad.
La ventaja exige que el sistema de archivos, la base o la capa de almacenamiento comprendan las zonas. Una aplicación diseñada para un dispositivo de bloques convencional no se beneficia automáticamente del modelo.
ZNS ilustra la tensión de NVMe: exponer más comportamiento puede mejorar la eficiencia, pero aumenta los requisitos de portabilidad del software.
Key Value, Simple Log Memory y Computational Programs amplían el espacio de nombres
Los conjuntos de comandos especializados permiten acceder a claves/valores, a una memoria de registro simple o a programas de cálculo ejecutados cerca del almacenamiento. Buscan reducir las traducciones y los movimientos de datos para ciertas cargas de trabajo.
Su adopción depende de los controladores, drivers, bibliotecas y aplicaciones. Un conjunto de comandos en la especificación no es una función universal de todos los SSD o arrays.
Cuantos más modelos ofrece el protocolo, más debe descubrir el software con precisión las capacidades y disponer de una ruta de respaldo. La modularidad técnica crea una nueva matriz comercial.
La conformidad ofrece una prueba útil sin certificar el rendimiento de extremo a extremo
Los programas y talleres de interoperabilidad verifican comportamientos precisos entre hosts y controladores. Detectan desviaciones que la lectura de la especificación no revela.
Una lista de conformidad no mide la latencia, la resistencia, la recuperación ni la seguridad en cada topología. Las funciones opcionales pueden diferir y la matriz driver-firmware evoluciona.
Los compradores deben tratar la conformidad como un suelo y probar su carga de trabajo, sus fallos y su ciclo de actualización.
NVMe separó la capacidad del servidor y desplazó la responsabilidad
El almacenamiento local asociaba a menudo el dispositivo, el host y el equipo de sistemas. La desagregación permite compartir un pool entre muchos consumidores y cambiar la asignación mediante software.
Hace intervenir a los equipos de red, almacenamiento, plataforma, seguridad y aplicación en el mismo incidente. Una degradación del fabric puede parecer un problema de base de datos; un firmware de controlador puede parecer una pérdida de red.
Por tanto, el beneficio económico depende de la utilización de la capacidad y de la capacidad operativa, no solo del precio por terabyte.
La IA hace visible la latencia del almacenamiento como coste de cómputo
Los entrenamientos escriben checkpoints, cargan datasets y mueven estados a gran escala. Cuando miles de aceleradores esperan, una variación en el almacenamiento puede desperdiciar una importante inversión en cómputo.
NVMe/TCP, RDMA, multipath y espacios de nombres compartidos ofrecen varias arquitecturas posibles. La elección debe considerar la congestión, la topología, el rendimiento, los metadatos, la recuperación y el comportamiento de las colas.
El objetivo no es solo un benchmark máximo, sino una latencia de cola y de recuperación predecible durante operaciones sincronizadas.
El conjunto 2.4 muestra a la vez la amplitud y la presión de versiones
NVMe 2.4 coordina la Base, los transportes, Boot, la Management Interface y los conjuntos de comandos especializados. Esta amplitud demuestra que NVMe se ha convertido en una pila, no en un simple conector de SSD.
Complica las declaraciones de soporte. Un host puede soportar la Base 2.4 sin soportar cada conjunto de comandos o cada función de seguridad. Un controlador puede ofrecer TCP sin las mismas capacidades que un producto RDMA.
El seguimiento debe centrarse en las versiones del driver, el firmware, el SO, el transporte y la herramienta de gestión. En la práctica, esta matriz forma parte del protocolo.
NVMe hizo el almacenamiento componible sin hacer el servicio simple
El protocolo común reduce un coste de cambio: el modelo de comandos puede sobrevivir al paso de PCIe a un fabric o de un proveedor a otro. Quedan otros costes: migración de datos, identidad del espacio de nombres, política de seguridad, red, observabilidad y soporte.
La ventaja estratégica es una separación más clara entre protocolo y producto. El riesgo es ocultar una arquitectura compleja detrás del mismo nombre NVMe.
El almacenamiento se vuelve programable y distribuible. No deja de ser un sistema de integridad en el que cada capa debe comprenderse ante un fallo.
Informe para miembros
Contexto ampliado del perfil
Inicia sesión con el nivel de membresía adecuado para desbloquear el informe completo y las notas de las fuentes.
Solo para Strategic Circle
Strategic Circle
Abierto a todos los lectores. Desbloquea informes de perfil después de unirte e iniciar sesión.
Únete a Strategic CircleSolo para Leadership Alliance
Leadership Alliance
Para propietarios y directivos cualificados de activos de propiedad intelectual; inicia sesión para desbloquear los informes de la alianza.
Unirse a Leadership Alliance
