Resumen

  • La contribución estratégica de Huang fue respaldar una plataforma de computación de propósito general en torno a las GPU de NVIDIA, no reclamar el trabajo de ingeniería de los arquitectos de CUDA, los equipos de compiladores, los autores de bibliotecas o los investigadores externos.
  • CUDA redujo una barrera central para la computación con GPU: los desarrolladores podían expresar trabajo paralelo mediante un modelo similar a C en lugar de disfrazar cada cálculo como una operación gráfica.
  • El uso científico temprano, la supercomputadora Titan acelerada por GPU y AlexNet proporcionaron pruebas cada vez más sólidas de que la misma arquitectura programable podía soportar cargas de trabajo importantes más allá de los juegos.
  • NVIDIA amplió la ventaja a través de bibliotecas, documentación, capacitación, integración con frameworks y compatibilidad entre generaciones de hardware. La compañía ahora describe CUDA como la base de una pila de computación completa.
  • El resultado comercial es sustancial pero no separable: NVIDIA reportó $215.9 mil millones en ingresos fiscales de 2026, mientras que los ingresos de CUDA no se divulgan como una línea separada. Sería incorrecto atribuir el crecimiento de la empresa solo al software.
  • El ecosistema crea valor real para el cliente y costos de cambio reales. HIP de AMD y el estándar multiplataforma SYCL muestran que la portabilidad es posible, pero la migración aún puede requerir cambios de código, ajuste de rendimiento y nuevos conocimientos operativos.

La decisión fue más grande que una característica gráfica

La versión más simple de la historia de NVIDIA pasa de mejores gráficos de juegos a inteligencia artificial, como si un mercado fluyera naturalmente hacia el siguiente. La versión más útil gira en torno a una decisión sobre quién debería poder programar el procesador y qué tipo de trabajo debería aceptar el procesador.

NVIDIA había construido un dispositivo altamente paralelo porque renderizar millones de píxeles recompensa la ejecución simultánea de cálculos similares. CUDA preguntó si esa maquinaria paralela podría convertirse en un objetivo de computación general en lugar de permanecer como una etapa especializada en el pipeline gráfico.

Esa no era una extensión obvia del producto. Un chip diseñado para gráficos ya podía programarse a través de interfaces gráficas, y los investigadores habían demostrado cálculos impresionantes no gráficos en él. Pero el camino era incómodo. A menudo tenían que traducir datos en texturas y la computación en operaciones de renderizado.

Un científico interesado en dinámica molecular o imágenes médicas tenía que entender conceptos que pertenecían a un sistema gráfico antes de llegar a la capacidad aritmética subyacente. Existía un rendimiento bruto; una plataforma de computación ampliamente utilizable, no.

La distinción importa al evaluar a Huang. Su papel no fue sentarse y escribir cada paso del compilador o definir cada regla de sincronización. La propia biografía de NVIDIA lo identifica como cofundador en 1993 que ha servido continuamente como presidente y director ejecutivo.

La decisión de la plataforma, por lo tanto, pertenece a su historial ejecutivo: podía dirigir capital, prioridades de producto y atención organizacional hacia un mercado cuyo tamaño a corto plazo era incierto. La implementación técnica pertenece a un grupo mucho más amplio.

Lacronología corporativa de NVIDIAdata la presentación de la arquitectura CUDA en 2006 y dice que el propósito era abrir el procesamiento paralelo de GPU a la ciencia y la investigación. Un artículo técnico de 2008 de John Nickolls, Ian Buck, Michael Garland y Kevin Skadron dice que el software CUDA se lanzó en 2007. Esas fechas describen diferentes hitos en lugar de una contradicción: la arquitectura apareció con la dirección unificada de gráficos y computación de NVIDIA a finales de 2006, y el entorno de desarrollo llegó a los programadores después.

Esta fue una expansión estratégica de la identidad del producto. Si la GPU seguía siendo solo un acelerador gráfico, la demanda seguiría vinculada principalmente a cargas de trabajo visuales. Si se convertía en un procesador paralelo programable, cada problema computacionalmente intensivo adecuado podría convertirse en una razón para comprar uno.

La empresa aún tendría que demostrar que se podían escribir aplicaciones útiles, que el código podía sobrevivir a las actualizaciones de hardware y que suficientes desarrolladores aceptarían un estilo diferente de computación. CUDA era, por lo tanto, una promesa sobre un mercado que los desarrolladores aún tenían que crear.

Los investigadores ya habían expuesto la oportunidad—y la fricción

La computación GPU de propósito general no comenzó en el evento de lanzamiento de NVIDIA. Investigadores académicos y programadores la habían estado explorando durante años. La tesis de Stanford de Ian Buck de 2004,"Stream Computing on Graphics Hardware", presentó Brook, un compilador y sistema de tiempo de ejecución que extendía C con conceptos de datos paralelos y abstraía la GPU como un coprocesador de transmisión.

La tesis explica por qué los procesadores gráficos eran atractivos: el paralelismo de datos y la intensidad aritmética les permitían dedicar un hardware sustancial a la computación repetida. También documenta el costo de la ruta anterior, incluyendo restricciones de memoria, sobrecarga del kernel y la dificultad de mapear algoritmos generales en un dispositivo de renderizado.

Brook es importante porque previene un mito de origen centrado en el fundador. El trabajo de Buck, junto con el de Tim Foley, Daniel Horn, Jeremy Sugerman, Kayvon Fatahalian, Mike Houston y Pat Hanrahan, demostró que un sistema de programación de alto nivel podía exponer la GPU sin hacer que cada programador manipulara primitivas gráficas.

Las páginas del proyecto de Stanford muestran que el trabajo se situaba dentro de una comunidad de investigación de computación de transmisión más grande y recibió apoyo de varias empresas y agencias públicas, incluida NVIDIA. Las ideas ya se estaban moviendo a través de fronteras institucionales antes de que CUDA se convirtiera en un producto.

NVIDIA contrató a Buck en 2004, según elrelato de la compañía sobre la historia de la programación de GPU. Esa página llama a Brook un precursor de CUDA y dice que el objetivo era crear un enfoque familiar para los programadores de C mientras se agregaban conceptos paralelos de alto nivel. El artículo posterior de CUDA nombra a Nickolls, Buck y Garland de NVIDIA junto a Skadron de la Universidad de Virginia.

Estas fuentes identifican un linaje técnico y un equipo; no respaldan llamar a Huang el único inventor de CUDA.

La propia contribución de Huang se ve mejor en cómo interpretó el uso disperso. En unaconversación de 2024 en la Escuela de Negocios de Stanford, recordó que NVIDIA hizo sus procesadores progresivamente más programables, desarrolló el lenguaje Cg y notó que los investigadores usaban la tecnología para reconstrucción de TC y química computacional.

Describió visitar a usuarios médicos y tratar esos ejemplos como señales de que la forma de computación podía resolver problemas que las máquinas convencionales manejaban mal. En su relato, cada uso le dio a la compañía más confianza para continuar.

Ese recuerdo es el relato de un participante, no una historia institucional completa. Su valor estratégico radica en la regla de decisión que revela. NVIDIA no esperó a que apareciera un mercado grande y bien medido llamado "computación GPU". Observó casos extremos técnicamente creíbles: imágenes, física de partículas, simulación de fluidos y química.

Eran pequeños en comparación con los gráficos de consumo, pero compartían una estructura: grandes cantidades de trabajo numérico paralelo. Huang vio una oportunidad de plataforma común detrás de aplicaciones separadas.

La apuesta fue, por lo tanto, basada en evidencia sin ser cierta. La investigación existente mostraba que las GPU podían acelerar cálculos adecuados. No demostró que los desarrolladores convencionales cambiarían la forma en que escribían software, que los científicos confiarían en un procesador derivado de juegos, o que NVIDIA podría mantener la cadena de herramientas a través de generaciones. La decisión convirtió una dirección de investigación prometedora en una obligación de producto de larga duración.

CUDA cambió la unidad de programabilidad

La importancia técnica de CUDA puede describirse sin tratarlo como magia. Elartículo de 2008 en ACM Queuepresenta tres abstracciones centrales: una jerarquía de grupos de hilos, memorias compartidas y sincronización de barreras. Un programador escribe un kernel—una función para ejecutar en paralelo—y organiza muchas instancias de ese trabajo en bloques y rejillas.

Los hilos dentro de un bloque pueden cooperar a través de memoria compartida y sincronización; los bloques están diseñados para ejecutarse de manera suficientemente independiente para que el tiempo de ejecución pueda distribuirlos entre las unidades de procesamiento disponibles.

Esa estructura conectó dos objetivos que a menudo entran en conflicto. Los programadores necesitaban suficiente control para usar la jerarquía de memoria y el hardware paralelo de manera eficiente. NVIDIA necesitaba que el software escalara de una generación de GPU a otra sin codificar una aplicación a un recuento de núcleos físicos único.

Al pedir a los desarrolladores que dividieran un problema en bloques independientes, CUDA permitió que el tiempo de ejecución programara el mismo programa en diferentes números de procesadores. La abstracción no hizo que cada algoritmo fuera paralelo, y no eliminó la necesidad de trabajo de rendimiento. Pero separó la descomposición lógica de un programa del recuento exacto de núcleos de GPU debajo.

El cambio puede entenderse como mover la interfaz más cerca del problema del desarrollador. Antes de un modelo de cómputo adecuado, un programador podría codificar números como texturas, lanzar una operación de renderizado y recuperar resultados como si fueran píxeles. Con CUDA, el programador podía expresar kernels, matrices, transferencias de memoria y sincronización directamente. El hardware aún imponía restricciones.

Los patrones de bifurcación, acceso a memoria, movimiento de datos e intensidad aritmética podían determinar si la aceleración valía la pena. Pero esas restricciones eran ahora conceptos de computación en lugar de un disfraz construido a partir de vocabulario gráfico.

El modelo de programación también hizo que la GPU fuera explícitamente heterogénea. La CPU seguía siendo el anfitrión: comenzaba la aplicación, preparaba los datos y lanzaba el trabajo. La GPU se convertía en el dispositivo: ejecutaba grandes números de hilos paralelos. Ladocumentación moderna de CUDAtodavía describe esa relación, mientras permite sistemas con múltiples CPU y GPU. CUDA no argumentaba que una GPU debería reemplazar a una CPU para todo.

Daba a los desarrolladores una forma de asignar diferentes partes de una carga de trabajo al tipo de procesador adecuado para ellas.

Ese límite es una razón por la que la plataforma pudo expandirse. Una empresa o laboratorio no tenía que descartar su aplicación existente y reescribir cada línea. Podía identificar kernels costosos, mover esas porciones a la GPU y mantener el trabajo en serie o con uso intensivo de control en la CPU. La adopción podía comenzar con un cuello de botella. Una vez que el entorno de desarrollo, las prácticas de implementación y el conocimiento del personal estaban en su lugar, podía seguir más trabajo.

La limitación es igualmente importante. La aceleración depende de la aplicación, implementación, sistema de comparación y cantidad de datos transferidos. El artículo temprano de CUDA reportó ejemplos que iban desde una mejora de 10 a 100 veces para dinámica molecular hasta cifras mucho más altas para implementaciones particulares de MRI y n-body. Esas mediciones demostraron posibilidad en los sistemas probados; no eran una promesa universal para cualquier programa trasladado a una GPU.

Una plataforma gana adopción no garantizando un multiplicador, sino haciendo que la búsqueda de aceleración adecuada sea repetible.

Un producto se convirtió en plataforma a través de complementos

Un compilador por sí solo no habría producido el ecosistema CUDA. Los desarrolladores necesitaban controladores, depuradores, perfiladores, documentación, ejemplos de código, bibliotecas matemáticas, material didáctico, soporte comunitario y hardware disponible a varios precios. Cada complemento reducía un costo de adopción diferente. Una biblioteca podía eliminar la necesidad de escribir una primitiva altamente optimizada. Un perfilador podía mostrar por qué un kernel se detenía. Un curso podía hacer que el pensamiento paralelo fuera enseñable.

Una política de compatibilidad podía permitir que un equipo comprara una nueva GPU sin descartar una aplicación funcional.

El artículo de 2008 ya describía programas CUDA en química computacional, resolución de matrices dispersas, ordenamiento, búsqueda y física. También señalaba la enseñanza universitaria. Estas aplicaciones tempranas importaban incluso cuando generaban pocos ingresos directos de software. Daban a otros desarrolladores ejemplos para copiar, producían preguntas que mejoraban las herramientas y creaban especialistas cuyo próximo empleador también podría elegir CUDA. Cada aplicación exitosa aumentaba la utilidad del hardware para alguien que no fuera su autor original.

Esta es la lógica económica de una plataforma de desarrolladores. NVIDIA proporciona un lado: procesadores, sistemas, compiladores y bibliotecas. Los desarrolladores externos proporcionan otro: aplicaciones, frameworks, códigos científicos y experiencia. Los usuarios están más dispuestos a comprar el hardware cuando ya existe software útil. Los desarrolladores están más dispuestos a apuntar a la plataforma cuando hay muchos usuarios y máquinas disponibles. Ningún lado tiene que ser planificado centralmente para que el ciclo se componga.

El logro estratégico de Huang fue mantener a NVIDIA comprometida con este ciclo cuando las primeras aplicaciones estaban dispersas en campos de investigación. Una empresa de chips acostumbrada a medir un producto por unidades y victorias de referencia tenía que tratar el software escrito por otras personas como parte del valor del producto. También tenía que apoyar a desarrolladores cuyos proyectos podrían tardar años en convertirse en grandes mercados.

La recompensa de una biblioteca de química optimizada o un curso universitario no aparecería necesariamente en el mismo trimestre que el gasto.

El compromiso se amplió con el tiempo. ElFormulario 10-K del año fiscal 2026 de NVIDIAdice que su pila de tecnología comienza con CUDA, luego agrega cientos de bibliotecas, frameworks, algoritmos, kits de desarrollo de software e interfaces de programación específicos del dominio. La presentación describe una arquitectura programable unificada que sirve a varios mercados a través de diferentes pilas de software construidas por NVIDIA, socios y desarrolladores externos. Esa es una descripción corporativa formal del modelo de plataforma, no solo un eslogan desde un escenario de conferencia.

La cronología de NVIDIA ahora dice que más de cuatro millones de desarrolladores crean miles de aplicaciones aceleradas, más de 40,000 empresas usan sus tecnologías de IA y 15,000 startups participan en su programa Inception. Esos son recuentos de ecosistema reportados por la compañía, por lo que no deben tratarse como medidas auditadas de uso activo o dependencia económica. Aún revelan lo que NVIDIA ha elegido contar. La compañía presenta a los desarrolladores y aplicaciones como activos operativos junto con el silicio.

La ciencia proporcionó prueba pública antes de que la IA se convirtiera en el titular

La computación científica no era un mercado secundario decorativo mientras CUDA esperaba el aprendizaje automático. Proporcionó cargas de trabajo exigentes e instituciones visibles que probaron la tesis de la plataforma. Las simulaciones, las imágenes y el álgebra lineal contienen abundante trabajo paralelo, pero también exponen límites numéricos, de memoria y de escalado. Una plataforma que no lograra producir resultados científicos reproducibles o no pudiera ejecutarse en sistemas grandes no ganaría credibilidad solo porque sus chips fueran rápidos en juegos.

Uno de los resultados más claros fue Titan en el Laboratorio Nacional de Oak Ridge. LaInstalación de Computación de Liderazgo de Oak Ridgedescribe a Titan como un Cray XK7 con 18,688 nodos de cómputo, cada uno combinando una CPU AMD Opteron de 16 núcleos con una GPU NVIDIA K20X. El sistema ofrecía más de 27 petaflops de rendimiento máximo teórico.

Oak Ridge dice que entregó diez veces la velocidad y cinco veces la eficiencia energética de su predecesor, Jaguar, mientras usaba solo modestamente más energía y la misma huella física.

Titan no demostró que las GPU deberían ejecutar todos los códigos científicos. Su diseño híbrido demostró casi lo contrario: las CPU y las GPU podían dividir el trabajo. Las aplicaciones tenían que exponer suficiente paralelismo para usar el acelerador, y los equipos científicos tenían que preparar sus códigos para una arquitectura diferente. La adquisición, por lo tanto, hizo tangible la decisión del ecosistema. Un laboratorio nacional estaba dispuesto a emparejar una máquina vasta con un esfuerzo de programación y aplicación que dependía del software acelerador.

La escala también cambió quién soportaba el costo de la adopción. En un escritorio, un desarrollador podía experimentar con una tarjeta gráfica. En Titan, los laboratorios, los equipos de aplicación, el proveedor del sistema y NVIDIA tenían que coordinar. Portar y optimizar códigos científicos importantes requería capacitación e ingeniería sostenida. Esa carga es parte de la historia de CUDA, no una nota al pie. La adopción de la plataforma es costosa antes de que se vuelva conveniente.

El resultado observable fue una supercomputadora híbrida funcional que permaneció en servicio hasta 2019. Oak Ridge atribuye un tiempo más rápido para la solución, una mayor complejidad del modelo y un realismo de simulación mejorado a la arquitectura. Esas son las conclusiones de la instalación sobre su propio sistema, pero el recuento de nodos, el modelo de GPU, el rendimiento máximo y la fecha de retiro proporcionan anclas concretas. CUDA había pasado de experimentos individuales a infraestructura de la que sus usuarios dependían para el trabajo científico programado.

La ciencia también influyó en la propia plataforma. Los algoritmos con acceso a memoria irregular, datos dispersos, reducciones o múltiples GPU presionaron a CUDA más allá del simple paralelismo similar a píxeles. Se desarrollaron bibliotecas y características de programación para manejar patrones más amplios. Este es un beneficio de elegir una plataforma en lugar de un acelerador único: las aplicaciones externas revelan lo que la próxima versión debe soportar.

El resultado no puede atribuirse solo a Huang. Oak Ridge seleccionó y operó la máquina; Cray integró el sistema; AMD suministró CPU; los equipos de NVIDIA construyeron hardware y software; los científicos adaptaron sus aplicaciones. La contribución responsable de Huang fue mantener a la compañía orientada hacia la computación acelerada el tiempo suficiente para que tal coalición se volviera práctica.

AlexNet cambió el centro de gravedad comercial

El resultado de AlexNet en 2012 a menudo se comprime en una historia en la que NVIDIA "causó" la IA moderna. El resultado real es tanto más específico como más informativo. Alex Krizhevsky, Ilya Sutskever y Geoffrey Hinton entrenaron una red neuronal convolucional profunda en ImageNet. Suartículodice que el entrenamiento tomó de cinco a seis días en dos GPU NVIDIA GTX 580 con 3GB de memoria cada una.

La implementación vinculada se llamaba cuda-convnet. En la competencia de 2012, un conjunto basado en su enfoque logró una tasa de error de prueba del 15.3 por ciento entre los cinco primeros, en comparación con el 26.2 por ciento de la segunda mejor entrada.

Esos números establecen un resultado, no una sola causa. Los investigadores diseñaron la red, los métodos de entrenamiento y el esquema de múltiples GPU. ImageNet proporcionó un gran conjunto de datos etiquetados. Los avances en métodos de redes neuronales importaron. Las GPU hicieron que la cantidad de cómputo fuera factible en días, y CUDA proporcionó una forma de programarlas. Elimine cualquiera de esos elementos y la historia cambia.

Darle todo el crédito a NVIDIA borraría la investigación; tratar los procesadores como incidentales ignoraría el propio relato del artículo sobre la memoria y el tiempo de entrenamiento.

Para Huang, AlexNet fue una señal más fuerte que las aplicaciones dispersas anteriores porque apuntaba hacia un método general con demanda computacional en expansión. Las redes neuronales podían mejorar a medida que los modelos y los conjuntos de datos crecían, mientras que el entrenamiento exponía grandes cantidades de álgebra lineal paralela. El apetito de la carga de trabajo se alineaba con la arquitectura de la GPU y con los años de inversión en software de NVIDIA.

CUDA significaba que la compañía no tenía que comenzar a construir un entorno de desarrollador después de que apareciera el avance. El entorno ya existía.

Aquí es donde la paciencia se convirtió en valor de opción estratégica. Antes de 2012, CUDA apoyaba campos científicos y técnicos cuyos mercados eran significativos pero fragmentados. Después de AlexNet, la misma base podía servir a una comunidad de aprendizaje automático en rápido crecimiento. Una plataforma construida solo para un paquete de química o un algoritmo de imágenes no se habría transferido tan fácilmente. Las abstracciones generales y las bibliotecas de CUDA le dieron a NVIDIA un camino de una ola de aplicación a otra.

La cronología corporativa de NVIDIA identifica a AlexNet como un hito de 2012 impulsado por sus GPU. Esa descripción es promocional y debe leerse junto con el artículo original. El artículo proporciona los detalles verificables de hardware, entrenamiento y tasa de error; la cronología muestra cómo NVIDIA interpretó el evento. La compañía vio AlexNet no como una venta afortunada de dos tarjetas de juegos, sino como la confirmación de que la computación acelerada podía convertirse en el motor de una transición importante del software.

La respuesta comercial se expandió más allá del lenguaje CUDA original. NVIDIA desarrolló y adquirió bibliotecas para operaciones de redes neuronales, construyó sistemas para entrenamiento, agregó características de hardware especializadas y apoyó frameworks que permitían a los investigadores trabajar a un nivel más alto. El valor de la decisión original no era que cada desarrollador de IA escribiera kernels CUDA en bruto. Era que los autores de frameworks y los equipos de bibliotecas pudieran apuntar a CUDA, permitiendo que millones de usuarios se beneficiaran a través de capas de abstracción.

La integración con frameworks hizo que la plataforma fuera ordinaria

Una tecnología se vuelve infraestructural cuando muchos usuarios dependen de ella sin interactuar con su capa más baja. Los desarrolladores de aprendizaje automático contemporáneos a menudo escriben operaciones de tensores en Python en lugar de CUDA C++. Sin embargo, el framework puede enviar esas operaciones a bibliotecas y kernels de CUDA. El usuario ve un tensor y un nombre de dispositivo; la plataforma maneja la compilación, asignación de memoria, programación y primitivas optimizadas debajo.

PyTorch hace explícita esta relación. Sudocumentación de semántica CUDAexplica cómo se asignan los tensores CUDA a los dispositivos, cómo las secuencias ordenan el trabajo, cómo se comunican múltiples GPU y cómo el código agnóstico al dispositivo puede elegir entre ejecución en CPU y CUDA. El framework reduce la cantidad de código específico de la plataforma que un investigador debe escribir, pero no borra la plataforma. Los conceptos de CUDA siguen siendo visibles cuando el rendimiento, la memoria o la sincronización importan.

TensorFlow proporciona otra señal independiente. Suguía de instalaciónofrece una ruta de paquete de GPU que incluye soporte CUDA y enumera los controladores NVIDIA, el CUDA Toolkit y cuDNN entre el software necesario para las configuraciones de GPU compatibles. Nuevamente, la mayoría de los usuarios no implementan un kernel de convolución. Los mantenedores de frameworks y bibliotecas absorben ese trabajo, y su soporte hace que el hardware de NVIDIA sea accesible para una población más amplia.

Esta estratificación fortalece a CUDA de dos maneras. Primero, un pequeño grupo de mantenedores expertos puede optimizar operaciones utilizadas por un número muy grande de aplicaciones. Un kernel de multiplicación de matrices o atención más rápido puede mejorar muchos modelos sin que cada equipo lo reescriba. Segundo, los frameworks se convierten en canales de distribución para la plataforma de hardware. Un estudiante que aprende un framework en una GPU CUDA puede llevar código similar a una estación de trabajo, instancia en la nube o clúster.

La misma estratificación puede debilitar la dependencia directa a nivel de aplicación. El código escrito contra un framework de alto nivel también puede ejecutarse en una CPU, una GPU AMD, un procesador Apple, un acelerador de Google u otro backend. Las API agnósticas al dispositivo crean espacio para la competencia. Pero la portabilidad de la sintaxis no es idéntica a la portabilidad del rendimiento. Las extensiones CUDA personalizadas, las suposiciones sobre la memoria, las operaciones no soportadas y los kernels ajustados a la plataforma aún pueden hacer que un movimiento sea costoso.

Esa tensión es central para el resultado de plataforma de Huang. NVIDIA se beneficia cuando las herramientas de alto nivel hacen que CUDA sea fácil de adoptar; enfrenta riesgo cuando esas mismas herramientas hacen que el hardware subyacente sea intercambiable. La respuesta de la compañía ha sido seguir agregando bibliotecas optimizadas, características del sistema y servicios para desarrolladores para que los frameworks abstractos se ejecuten especialmente bien en su pila. Por lo tanto, la competencia ocurre debajo de la interfaz de Python tanto como en la hoja de especificaciones del chip.

La compatibilidad convirtió el código pasado en una razón para comprar la próxima GPU

Los ecosistemas de desarrolladores se acumulan solo si el trabajo de ayer retiene valor. Si cada nuevo procesador forzara a reconstruir una aplicación desde los primeros principios, las bibliotecas y las habilidades se depreciarían rápidamente. El diseño de compatibilidad de NVIDIA es, por lo tanto, una característica económica además de técnica.

Ladocumentación actual de la plataforma CUDAexplica que el código de alto nivel puede compilarse a PTX, una representación intermedia que el controlador puede traducir para una GPU física. Los ejecutables pueden llevar binarios para varias arquitecturas más PTX para las futuras. La documentación dice que PTX puede compilarse en tiempo de ejecución para capacidades de cómputo posteriores, mientras que la compatibilidad binaria se aplica dentro de los límites de arquitectura definidos. Las promesas tienen límites, pero dan a los desarrolladores caminos soportados a través de las generaciones.

La compatibilidad cambia el comportamiento de compra. Una organización con aplicaciones CUDA funcionales, personal capacitado y herramientas de implementación puede considerar una nueva GPU NVIDIA como una continuación en lugar de un proyecto de software nuevo. El hardware nuevo aún puede requerir ajuste para lograr su mejor rendimiento, y los binarios antiguos pueden no usar nuevas características. Pero la perspectiva de ejecutar el trabajo existente reduce el riesgo de adopción. Cada generación de hardware puede heredar la demanda creada por la inversión de software anterior.

También cambia las obligaciones de NVIDIA. Un proveedor de plataforma no puede optimizar solo para un nuevo punto de referencia y abandonar aplicaciones antiguas sin consecuencias. Los controladores deben cargar código más antiguo dentro de los límites prometidos. Las bibliotecas deben gestionar la obsolescencia. La documentación debe explicar qué combinaciones de toolkit, controlador y GPU son compatibles. Los errores en una capa de compatibilidad pueden afectar aplicaciones que la compañía nunca escribió. El ecosistema es un activo precisamente porque también es una carga de mantenimiento.

Esto ayuda a explicar por qué CUDA se volvió más defendible que un solo chip rápido. El rendimiento del hardware puede ser superado por un competidor o desplazado por un acelerador especializado. Un cuerpo de aplicaciones compatibles, bibliotecas y conocimiento operativo se mueve más lentamente. Los competidores deben ofrecer suficiente beneficio para justificar no solo una compra de hardware sino también migración, validación y reciclaje.

La ventaja no es permanente. La compatibilidad misma puede volverse engorrosa, y las capas de abstracción pueden reducir las diferencias de plataforma. Los servicios en la nube permiten a los clientes alquilar alternativas sin comprar un nuevo clúster. Los estándares abiertos pueden hacer que el código sea portátil. Sin embargo, la larga continuidad de CUDA significa que la comparación rara vez es entre dos sistemas en blanco. Un lado a menudo llega con años de trabajo acumulado.

Los resultados financieros de NVIDIA muestran escala, no una línea de ingresos de CUDA

El resultado comercial más visible es la transformación de NVIDIA de un proveedor de chips enfocado en gráficos a un proveedor de sistemas y software de computación para centros de datos. Su presentación del año fiscal 2026 reporta ingresos de $215.938 mil millones, un 65% más que el año fiscal 2025. Compute and Networking contribuyó con $193.479 mil millones, en comparación con $22.459 mil millones de Graphics. Los ingresos del centro de datos aumentaron un 68% interanual, lo que la compañía atribuyó a cambios en la computación acelerada y la plataforma de IA.

Esas cifras son extraordinarias, pero no miden CUDA por separado. NVIDIA vende GPU, redes, sistemas, servicios y algo de software. La demanda de los clientes también refleja el crecimiento de modelos, el gasto de capital en la nube, el suministro de memoria, la capacidad de fabricación, el rendimiento de la red y las características de las arquitecturas recientes. CUDA ayuda a que los sistemas sean útiles, pero la presentación no permite que un externo calcule cuántos dólares desaparecerían sin él.

La afirmación correcta es más estrecha: la estrategia declarada de NVIDIA y su segmento de ingresos más grande ahora dependen de una plataforma de computación completa cuya base incluye CUDA. El 10-K dice que la compañía combina hardware, sistemas, software, algoritmos, bibliotecas, modelos, conjuntos de datos y servicios. También dice que una base de desarrolladores grande y creciente y una base instalada aumentan el valor de la plataforma. La administración está describiendo explícitamente los efectos de red como parte del modelo de negocio.

La inversión proporciona otro resultado medible. NVIDIA reportó $18.497 mil millones en gastos de investigación y desarrollo para el año fiscal 2026, un 43% más que el año anterior. Dijo que aproximadamente 31,000 de sus 42,000 empleados trabajaban en investigación y desarrollo al final del año y que la inversión acumulada en esa función desde su inicio superó los $76.7 mil millones. Esos totales cubren toda la compañía, no solo CUDA.

Muestran la escala organizacional que ahora sostiene la arquitectura compartida y sus muchas pilas de software.

La escala también trae riesgo de concentración y ejecución. La presentación dice que un cliente directo representó el 22% de los ingresos del año fiscal 2026 y otro representó el 14%, principalmente en Compute and Networking. Una plataforma puede diversificar los casos de uso mientras las ventas permanecen concentradas entre los constructores de sistemas y los proveedores de nube. El amplio alcance de desarrolladores de CUDA no significa que NVIDIA facture directamente a millones de desarrolladores o que el poder adquisitivo esté distribuido uniformemente.

El resultado financiero, por lo tanto, respalda una historia de plataforma sin probar una ecuación causal simple. La decisión de Huang le dio a NVIDIA una forma duradera de expandir lo que sus procesadores podían hacer. La demanda de IA, la ejecución de ingeniería, las asociaciones de suministro y la innovación externa convirtieron esa opción en ingresos. Una evaluación rigurosa puede atribuir a CUDA un papel fundamental mientras se niega a etiquetar cada dólar como "ingresos de CUDA".

El foso es software útil—y el costo de dejarlo

La gente a menudo describe CUDA como un foso. La metáfora está incompleta a menos que explique qué hay en el agua. La barrera no es meramente que CUDA sea un entorno de programación controlado por NVIDIA. Es el valor combinado de bibliotecas ajustadas, aplicaciones funcionales, documentación, experiencia del personal, prácticas de depuración, compatibilidad y hardware disponible. Los clientes se quedan cuando esa combinación ahorra más tiempo o produce mejores resultados que las alternativas, no porque un nombre solo impida el movimiento.

Eldocumento de 2025 de la OCDE sobre competencia en infraestructura de IAdescribe el software como crítico para hacer que las GPU sean efectivas y cita una estimación de que NVIDIA tenía más del 80% del mercado de GPU utilizadas en IA. Vincula la posición de la compañía al rendimiento, la ventaja del primero en moverse y CUDA.

El porcentaje es una estimación de mercado secundaria utilizada por la OCDE, no un censo de envíos oficial, por lo que debe tratarse como una indicación de concentración en lugar de una cuota universal exacta.

Unresumen posterior de la mesa redonda de competencia de la OCDEdescribe los efectos de red indirectos entre las GPU de NVIDIA y CUDA: más software hace que el hardware sea atractivo, mientras que una adopción más amplia del hardware fomenta más software. También registra preocupaciones de que la dependencia de un entorno de desarrollo puede hacer que el cambio sea técnicamente difícil y costoso, a veces requiriendo rediseño de software y tiempo. Al mismo tiempo, la discusión caracteriza el mercado como potencialmente disputable porque otros fabricantes de chips, proveedores de nube y desarrolladores de IA están buscando alternativas.

Esta descripción equilibrada es más útil que calificar cada dependencia como abusiva o cada ventaja como merecida. CUDA crea eficiencias: los desarrolladores pueden reutilizar código optimizado, las organizaciones pueden contratar personas con habilidades relevantes y los mantenedores de frameworks pueden apuntar a una plataforma estable. Esos beneficios son la razón por la que el ecosistema tiene poder. La misma reutilización puede convertirse en un costo de cambio cuando un comprador quiere un acelerador diferente.

El costo varía según la carga de trabajo. Una aplicación que utiliza solo operaciones de framework de alto nivel disponibles en varios backends puede moverse con cambios de código limitados, aunque el rendimiento y la implementación aún necesitan pruebas. Un código científico con años de kernels CUDA personalizados y bibliotecas específicas de NVIDIA puede requerir una ingeniería importante. Una empresa que ha automatizado un clúster CUDA también puede necesitar nuevas prácticas de monitoreo, programación y depuración.

"Bloqueado" no es un estado binario; es una pila de costos de migración.

La decisión de Huang puede evaluarse desde dos perspectivas a la vez. Desde la perspectiva de NVIDIA, la inversión acumulada de los desarrolladores hace que cada generación sea más valiosa y menos vulnerable al lanzamiento de un chip rival. Desde la perspectiva del cliente, el ecosistema puede reducir el costo de construir hoy mientras aumenta el costo de cambiar de proveedor mañana. Ambos son resultados del mismo éxito de plataforma.

Los competidores atacan el costo de programación, no solo el silicio

La existencia de herramientas de portabilidad muestra que los competidores entienden dónde está la ventaja. Ladocumentación de HIP de AMDdescribe un runtime de C++ y un lenguaje de kernel diseñados para permitir que una fuente se dirija a GPU AMD y NVIDIA. Su material de portabilidad explica cómo los desarrolladores pueden convertir código CUDA incrementalmente y comparar función y rendimiento con el original.

La mera presencia de un camino de migración confirma dos cosas: el código CUDA tiene suficiente valor para preservar, y moverlo es un problema que vale la pena resolver con herramientas.

Khronos toma una ruta basada en estándares.SYCLes una abstracción de C++ abierta, libre de regalías y multiplataforma para procesadores heterogéneos que incluyen CPU, GPU y FPGA. Su documentación es cuidadosa sobre el límite: un lenguaje y API comunes pueden hacer que el código sea portátil, pero no garantizan una portabilidad de rendimiento automática y perfecta. Los desarrolladores aún pueden necesitar variantes y ajustes específicos de la arquitectura.

Estas alternativas evitan una historia determinista en la que CUDA debe dominar para siempre. Los frameworks de alto nivel admiten cada vez más múltiples dispositivos. Las plataformas en la nube pueden exponer aceleradores competidores. Los grandes compradores pueden construir chips personalizados para cargas de trabajo particulares. Los estándares de programación abiertos pueden reducir la cantidad de código vinculado a un proveedor. Las cargas de trabajo de inferencia pueden recompensar diferentes compensaciones de costo y energía que los sistemas de entrenamiento gigantes.

Sin embargo, una capa de portabilidad debe competir con la madurez, no solo con la sintaxis. Un kernel traducido debe ser correcto. Una biblioteca debe cubrir la operación necesaria. Las herramientas de rendimiento deben identificar cuellos de botella. La implementación debe ser estable. La documentación y el conocimiento de la comunidad deben responder a los casos extremos. La aplicación debe seguir funcionando a medida que cambian tanto la plataforma de origen como la de destino. Esta es la razón por la que los ecosistemas de software son difíciles de copiar rápidamente incluso cuando un procesador rival es capaz.

La competencia también puede mejorar CUDA. Si los clientes pueden moverse, NVIDIA debe seguir ganando adopción a través del rendimiento, la confiabilidad y la productividad del desarrollador. Si las alternativas cierran brechas de bibliotecas, la compañía no puede confiar solo en el código histórico. La plataforma debe continuar absorbiendo nuevos modelos, formatos numéricos, sistemas de memoria y patrones de múltiples GPU. Un foso que deja de evolucionar se convierte en una isla.

La cuestión política no es si una plataforma propietaria puede tener éxito. Es si la conducta en torno a ese éxito bloquea injustamente las alternativas, restringe la interoperabilidad o vincula los mercados adyacentes de manera dañina. Los materiales de la OCDE identifican estos como asuntos para un escrutinio continuo, no como conclusiones de que CUDA en sí mismo sea ilegal. El hecho observable es que el software y el hardware se refuerzan mutuamente con suficiente fuerza para moldear la estructura del mercado.

La geopolítica puede dividir un ecosistema que la escala una vez unificó

La propuesta temprana de CUDA era una amplia disponibilidad: un desarrollador podía aprender un modelo y ejecutarlo en hardware de NVIDIA en tarjetas de consumo, estaciones de trabajo y servidores. Los controles de exportación y las políticas tecnológicas regionales complican esa propuesta. La presentación del año fiscal 2026 de NVIDIA dice que las restricciones efectivamente le habían cerrado el mercado de cómputo de centros de datos de China al final del año y advirtió que la exclusión podría ayudar a los competidores a construir ecosistemas más grandes de desarrolladores y clientes.

Esa advertencia revela cómo NVIDIA valora el acceso al mercado. Una venta perdida no es solo una unidad perdida. Puede ser un desarrollador que aprende otra cadena de herramientas, una universidad que enseña una plataforma diferente, una nube que optimiza una alternativa y una aplicación que ya no trata a CUDA como su predeterminada. La competencia de ecosistemas se compone en ambas direcciones.

Esto no demuestra que ninguna política de exportación específica sea correcta o incorrecta. Las decisiones de seguridad nacional sopesan consideraciones más allá de los ingresos de la empresa y la adopción de software. Sí muestra una restricción en la estrategia de plataforma de Huang: ninguna empresa privada controla todas las jurisdicciones, cadenas de suministro o reglas a través de las cuales su hardware llega a los desarrolladores. Una base de programación globalmente unificada puede fragmentarse cuando el acceso a los dispositivos subyacentes se fragmenta.

El suministro es otra restricción. CUDA no puede proporcionar aceleración sin procesadores, memoria, empaquetado, energía, redes y capacidad de centro de datos. NVIDIA diseña sus chips principales pero depende de socios de fabricación. La plataforma reciente se ha expandido de una tarjeta GPU a sistemas completos cuyas partes deben trabajar juntas. El software aumenta la utilidad del hardware escaso; no puede fabricar más.

La concentración de clientes crea una dependencia adicional. Los grandes proveedores de nube distribuyen capacidad CUDA a muchos usuarios, pero también pueden desarrollar sus propios aceleradores y promover frameworks alternativos. La plataforma de NVIDIA ayuda a las nubes a vender servicios de computación, mientras que las nubes median el acceso a los productos de NVIDIA. El ecosistema no es un bloqueo unidireccional. Los clientes importantes pueden moldear los precios, la implementación y las elecciones de arquitectura competidora.

Estas restricciones mantienen la historia de liderazgo fundamentada. La decisión de Huang produjo apalancamiento, no invulnerabilidad. La empresa debe mantener el software, enviar hardware, navegar la regulación y persuadir a cada nueva generación de desarrolladores. Una plataforma pasada compra tiempo y distribución; no cancela el riesgo de ejecución.

El crédito pertenece al liderazgo, los ingenieros y los usuarios en diferentes proporciones

La Medalla de Honor del IEEE de 2026 ofrece una formulación externa útil.IEEE Spectrumdice que Huang fue reconocido por su liderazgo en el desarrollo de GPU y su aplicación a la computación científica y la IA. La palabra "liderazgo" es precisa. Reconoce la visión técnica y la dirección organizacional sin afirmar que él personalmente creó cada componente.

Las acciones documentadas más fuertes de Huang en la historia de CUDA son el reconocimiento de patrones, el compromiso y el encuadre de la plataforma. Vio los usos no gráficos como evidencia de una necesidad común de cómputo. Respaldó una arquitectura programable unificada. Mantuvo el software y la adopción de desarrolladores como centrales mientras la compañía avanzaba a través de la computación científica y la IA. También describe públicamente a NVIDIA como una plataforma en lugar de un proveedor de componentes, una descripción que ahora coincide con su presentación regulatoria.

La contribución de los ingenieros es el sistema mismo. Buck y el equipo de Brook proporcionaron un linaje de investigación importante. Nickolls, Buck, Garland, Skadron y muchos colegas definieron y explicaron el modelo temprano. Los equipos de compiladores, controladores, bibliotecas, arquitectura y relaciones con desarrolladores convirtieron un lanzamiento en un entorno mantenido. Los autores de frameworks, investigadores y desarrolladores de aplicaciones extendieron CUDA a campos que NVIDIA no podría haber construido sola.

Los usuarios proporcionaron las pruebas decisivas. Las imágenes médicas y la química ofrecieron señales tempranas. Los científicos expusieron la escala y las demandas numéricas. El equipo de AlexNet demostró un resultado de aprendizaje automático que cambió las prioridades de la industria. Los mantenedores de PyTorch y TensorFlow hicieron que la ejecución en GPU estuviera disponible a través de frameworks ampliamente utilizados. Los clientes luego decidieron si el sistema total justificaba su costo.

Separar estos roles mejora, no disminuye, el historial de Huang. El liderazgo ejecutivo no es valioso porque imita la ingeniería. Es valioso cuando elige una dirección que permite que la ingeniería y la innovación externa se combinen. El resultado verificable es una organización que mantuvo una arquitectura de programación relevante a través de varias oleadas de computación.

También hace más clara la rendición de cuentas. A Huang se le puede atribuir el compromiso estratégico y responsabilizarse por la conducta de la plataforma, las prioridades de inversión y las afirmaciones del mercado. A los equipos técnicos se les puede atribuir la implementación. Los investigadores conservan la autoría de sus descubrimientos. Los clientes pueden juzgar si los beneficios de la plataforma superan sus costos. Una historia de héroe difumina esas líneas; una historia de plataforma las requiere.

Una tarjeta de puntuación práctica para la apuesta a largo plazo

Veinte años después de la presentación en 2006, la decisión de CUDA puede probarse contra varios resultados observables.

Primero, ¿el modelo de programación sobrevivió a su hardware de lanzamiento? Sí. La documentación actual de CUDA aborda los sistemas modernos de múltiples GPU mientras preserva los conceptos centrales de kernels, jerarquías de hilos y ejecución heterogénea. Los mecanismos de compatibilidad dan a las aplicaciones caminos a través de múltiples generaciones, dentro de los límites establecidos.

Segundo, ¿los desarrolladores lo usaron fuera de los gráficos? Sí. La literatura técnica temprana documenta química, imágenes, álgebra lineal y física. Titan hizo de la aceleración por GPU parte de un gran sistema de laboratorio nacional. AlexNet usó dos GPU NVIDIA y una implementación CUDA para un resultado histórico de clasificación de imágenes. La documentación actual de PyTorch y TensorFlow expone CUDA como una ruta de ejecución compatible.

Tercero, ¿se formó un ecosistema de complementos? NVIDIA dice que más de cuatro millones de desarrolladores ahora construyen aplicaciones aceleradas y describe cientos de bibliotecas, frameworks, algoritmos e interfaces de desarrollo en su presentación fiscal. La actividad exacta detrás de los recuentos de la compañía no es pública, pero la documentación independiente de frameworks confirma que CUDA está integrado en capas de software ampliamente utilizadas.

Cuarto, ¿la plataforma apoyó un negocio más grande? Los ingresos de Compute and Networking de NVIDIA alcanzaron $193.479 mil millones en el año fiscal 2026, superando con creces su segmento de Graphics. La compañía identifica la computación acelerada y la IA como los impulsores del crecimiento del centro de datos y coloca a CUDA en la base de su pila. Ninguna divulgación aísla la parte causal de CUDA, por lo que el resultado es asociación dentro de una estrategia declarada, no un cálculo de ingresos de software independiente.

Quinto, ¿la estrategia creó defendibilidad? La OCDE describe un mercado de GPU para IA altamente concentrado y vincula CUDA a efectos de red y costos de cambio. AMD HIP y SYCL existen en parte para reducir esos costos. La inversión continua en portabilidad es en sí misma evidencia de que la base de software instalada importa competitivamente.

Sexto, ¿hay costos no resueltos? Sí. La migración puede ser costosa, la concentración de la plataforma puede reducir la elección del comprador, la compatibilidad requiere mantenimiento continuo y el acceso global puede verse interrumpido por la regulación y las limitaciones de suministro. El hardware alternativo y los modelos de programación mantienen el mercado disputable. Una decisión de plataforma exitosa crea obligaciones además de retornos.

Esta tarjeta de puntuación evita dos errores. Uno es la certeza retrospectiva: el éxito posterior de CUDA no significa que su mercado temprano estuviera garantizado. El otro es la mitología del fundador: la continuidad estratégica no convierte a Huang en el único creador del trabajo técnico producido por muchas personas. El logro perdurable es la alineación del liderazgo, la arquitectura, el software y la adopción externa.

La decisión perdurable fue subsidiar la invención de otros

El efecto estratégico más profundo de CUDA fue hacer del hardware de NVIDIA un lugar donde otras personas pudieran crear valor. Un científico podía acelerar una simulación, un equipo de framework podía optimizar operaciones de tensores, una startup podía implementar un modelo y una nube podía vender acceso al sistema resultante. NVIDIA no necesitaba inventar cada aplicación. Necesitaba hacer que la próxima aplicación fuera más propensa a elegir su plataforma.

Eso cambia la naturaleza de una empresa de semiconductores. El producto ya no está completo cuando el chip pasa la validación. Permanece inacabado hasta que los compiladores, bibliotecas y aplicaciones hacen que el silicio sea útil, y permanece en riesgo si la próxima ola de software se forma en otro lugar. Las relaciones con desarrolladores, la compatibilidad y la educación se convierten en funciones estratégicas. El horizonte temporal se extiende más allá de un ciclo de hardware.

La apuesta a largo plazo de Huang tuvo éxito porque unió una ventaja arquitectónica real a ese horizonte más largo. Las GPU tenían rendimiento paralelo creado para gráficos. Los investigadores habían demostrado que otros problemas podían usarlo. CUDA redujo la barrera de programación. Las bibliotecas y los frameworks ampliaron el acceso. La compatibilidad preservó el trabajo acumulado. Cada capa hizo que la siguiente fuera más valiosa.

La misma estructura explica el debate actual sobre la dependencia. Cuando una plataforma ahorra años de trabajo a los desarrolladores, dejarla puede costar años de trabajo. Los clientes se benefician del ecosistema y quedan expuestos a su propietario. Los competidores deben igualar una experiencia, no solo un punto de referencia. Los reguladores ven eficiencias potenciales y barreras potenciales en el mismo conjunto de hechos.

La conclusión más justa no es que CUDA solo creó la IA ni que NVIDIA simplemente tuvo la suerte de vender el chip correcto. Huang tomó una decisión de plataforma temprana y sostenida frente a una demanda incierta. Los ingenieros de NVIDIA y los predecesores académicos construyeron el modelo de programación y su maquinaria. Los investigadores y desarrolladores demostraron lo que podía hacer. El ecosistema resultante ayudó a convertir la GPU de un componente gráfico en una plataforma de computación general—y le dio a NVIDIA tanto su activo estratégico más fuerte como una de sus mayores responsabilidades.