摘要
黄的战略贡献是围绕 NVIDIA GPU 支持一个通用计算平台,而非声称 CUDA 架构师、编译器团队、库作者或外部研究人员的工程工作。
CUDA 降低了 GPU 计算的一个核心障碍:开发者可以通过类似 C 的模型表达并行工作,而无需将每次计算伪装成图形操作。
早期的科学应用、GPU 加速的 Titan 超级计算机和 AlexNet 提供了越来越强的证据,表明同一可编程架构可以支持游戏之外的重要工作负载。
NVIDIA 通过库、文档、培训、框架集成和跨硬件代际的兼容性扩展了优势。该公司现在将 CUDA 描述为完整计算堆栈的基础。
商业成果显著但不可分离:NVIDIA 2026 财年收入为 2159 亿美元,而 CUDA 收入未作为单独项目披露。将公司增长仅归因于软件是不正确的。
生态系统创造了真正的客户价值和真正的转换成本。AMD 的 HIP 和跨平台 SYCL 标准表明可移植性可行,但迁移仍可能需要代码更改、性能调优和新的运营知识。
这一决策超越了图形特性
NVIDIA 历史的最简单版本是从更好的游戏图形到人工智能,仿佛一个市场自然地流入下一个。而更有用的版本则围绕一个决策:谁应该能够编程处理器,以及处理器应该接受什么样的工作。
NVIDIA 构建了一个高度并行的设备,因为渲染数百万像素奖励相似计算的同步执行。CUDA 提出了一个问题:这种并行机制能否成为通用的计算目标,而不是保持在图形流水线中的专门阶段。
这并非一个明显的产品扩展。为图形设计的芯片已经可以通过图形接口进行编程,研究人员已经在其上展示了令人印象深刻的非图形计算。但这条路线很笨拙。他们通常必须将数据转换为纹理,将计算转换为渲染操作。
对分子动力学或医学成像感兴趣的科学家在触及底层的算术能力之前,必须理解属于图形系统的概念。原始吞吐量存在;但一个广泛可用的计算平台并不存在。
这一区别在评估黄时至关重要。他的角色不是坐下来编写每个编译器阶段或定义每个同步规则。NVIDIA 自己的传记将他认定为 1993 年联合创始人,此后一直担任总裁兼首席执行官。
因此,平台决策属于他的执行记录:他可以将资本、产品优先级和组织注意力导向一个近期规模不确定的市场。技术实现属于一个更广泛的群体。
NVIDIA 的公司时间线将 CUDA 架构的发布定为 2006 年,并表示其目的是将 GPU 并行处理开放给科学和研究。John Nickolls、Ian Buck、Michael Garland 和 Kevin Skadron 于 2008 年发表的一篇技术论文称 CUDA 软件于 2007 年发布。这些日期描述了不同的里程碑而非矛盾:该架构于 2006 年底随着 NVIDIA 统一的图形与计算方向出现,之后开发环境才到达程序员手中。
这是产品身份的战略性扩展。如果 GPU 仅仅保持为图形加速器,需求将主要与视觉工作负载绑定。如果它成为可编程并行处理器,每个合适的计算密集型问题都可能成为购买的理由。
该公司仍然需要证明可以编写有用的应用程序,代码能够经受硬件升级,以及足够多的开发者会接受一种不同的计算风格。因此,CUDA 是关于一个开发者尚未创建的市场的承诺。
研究人员已经揭示了机会——以及摩擦
通用 GPU 计算并非始于 NVIDIA 的发布活动。学术研究人员和程序员已经探索多年。Ian Buck 2004 年的斯坦福博士论文《图形硬件上的流计算》提出了 Brook,一个用数据并行概念扩展 C 并将 GPU 抽象为流协处理器的编译器和运行时系统。
该论文解释了图形处理器为何具有吸引力:数据并行性和算术强度使它们能够将大量硬件用于重复计算。它也记录了旧路线的成本,包括内存限制、内核开销以及将通用算法映射到渲染设备的难度。
Brook 之所以重要,是因为它阻止了以创始人为中心的起源神话。Buck 的工作,连同 Tim Foley、Daniel Horn、Jeremy Sugerman、Kayvon Fatahalian、Mike Houston 和 Pat Hanrahan 的工作,证明了一个更高级的编程系统可以暴露 GPU,而无需让每个程序员操作图形原语。
斯坦福的项目页面显示,这项工作位于一个更大的流计算研究社区中,并得到了包括 NVIDIA 在内的多家公司和公共机构的支持。在 CUDA 成为产品之前,这些想法已经在跨机构边界传播。
根据 NVIDIA 对 GPU 编程历史的记述,该公司于 2004 年雇佣了 Buck。该页面称 Brook 是 CUDA 的前身,并表示其目标是创建一种 C 程序员熟悉的方法,同时添加更高级的并行概念。后来的 CUDA 论文列出了 NVIDIA 的 Nickolls、Buck 和 Garland 以及弗吉尼亚大学的 Skadron。
这些来源识别了一个技术谱系和团队;它们不支持将黄称为 CUDA 的唯一发明者。
黄自己的贡献最好从他如何解读零散的使用中看出。在2024 年斯坦福商学院的一次对话中,他回忆 NVIDIA 使其处理器逐步更加可编程,开发了 Cg 语言,并注意到研究人员将这项技术用于 CT 重建和计算化学。
他描述了拜访医疗用户,并将这些示例视为一种计算形式可以解决传统机器处理不当的问题的信号。在他的叙述中,每次使用都给公司更多信心继续下去。
那是参与者的回忆,而非完整的机构历史。其战略价值在于它揭示的决策规则。NVIDIA 没有等待一个称为“GPU 计算”的大型、整齐测量的市场出现。它着眼于技术上可信的边缘案例:成像、粒子物理、流体模拟和化学。
这些与消费图形相比很小,但它们共享一种结构——大量并行数值工作。黄在独立的应用背后看到了一个共同的平台机会。
因此,这一赌注是有证据引导的,但并不确定。现有研究表明 GPU 可以加速合适的计算。它并未证明主流开发者会改变他们编写软件的方式,科学家会信任一个源自游戏的处理器,或者 NVIDIA 能够在几代之间维护工具链。这一决策将一个有前景的研究方向转化为一个长期的产品义务。
CUDA 改变了可编程性的单位
CUDA 的技术重要性可以在不将其视为魔法的情况下描述。2008 年的《ACM Queue》论文提出了三个核心抽象:线程组层次结构、共享内存和屏障同步。程序员编写一个内核——一个并行运行的函数——并将该工作的许多实例组织成块和网格。
块内的线程可以通过共享内存和同步进行协作;块被设计为足够独立地运行,以便运行时可以将它们分配到可用的处理单元上。
这种结构连接了两个经常冲突的目标。程序员需要足够的控制来有效地使用内存层次结构和并行硬件。NVIDIA 需要软件能从一代 GPU 扩展到另一代,而无需将应用程序硬编码到单个物理核心数量。
通过要求开发者将问题划分为独立的块,CUDA 允许运行时在具有不同处理器数量的系统上调度相同的程序。这一抽象并未使每个算法并行,也未消除性能工作。它确实将程序的逻辑分解与其下面的 GPU 核心确切数量分离开来。
这种转变可以理解为将接口移近开发者的问题。在合适的计算模型之前,程序员可能将数字编码为纹理,启动渲染操作,并将结果像像素一样检索出来。有了 CUDA,程序员可以直接表达内核、数组、内存传输和同步。硬件仍然施加约束。
分支模式、内存访问、数据移动和算术强度可能决定加速是否值得。但这些约束现在是计算概念,而不是用图形词汇构建的伪装。
编程模型也使 GPU 明确地成为异构的。CPU 仍然是主机:它启动应用程序、准备数据和启动工作。GPU 成为设备:它执行大量并行线程。现代 CUDA 文档仍然描述这种关系,同时允许具有多个 CPU 和 GPU 的系统。CUDA 并未主张 GPU 应该取代 CPU 处理一切。
它给了开发者一种方法,将工作负载的不同部分分配给适合它们的处理器类型。
这个边界是平台能够传播的原因之一。公司或实验室不必丢弃现有应用程序并重写每一行。它可以识别昂贵的内核,将这些部分移到 GPU,并将串行或控制密集型工作保留在 CPU 上。采用可以从一个瓶颈开始。一旦开发环境、部署实践和员工知识到位,更多工作可以随之而来。
限制也同样重要。加速取决于应用程序、实现、比较系统和传输的数据量。早期的 CUDA 论文报告了示例,范围从分子动力学的 10 到 100 倍改进,到特定 MRI 和 n 体实现的更高数字。这些测量展示了在测试系统上的可能性;它们不是对任何移到 GPU 的程序的通用保证。
一个平台获得采用,不是通过保证一个乘数,而是通过使寻找合适的加速变得可重复。
产品通过补充品成为平台
仅凭编译器不会产生 CUDA 生态系统。开发者需要驱动程序、调试器、性能分析器、文档、代码示例、数学库、教学材料、社区支持和多个价位的硬件。每个补充品降低了不同的采用成本。一个库可以消除编写高度调优的原语的需要。一个性能分析器可以显示内核为何停滞。一个课程可以使并行思维变得可教授。
兼容性策略可以让团队购买新的 GPU 而无需丢弃工作正常的应用程序。
2008 年的论文已经描述了计算化学、稀疏矩阵求解、排序、搜索和物理中的 CUDA 程序。它还指向大学教学。这些早期应用即使在产生很少的直接软件收入时也很重要。它们给其他开发者提供了可以复制的示例,产生了改进工具的问题,并创造了其下一个雇主也可能选择 CUDA 的专家。每个成功的应用增加了硬件对其原始作者以外某人的有用性。
这就是开发者平台的经济逻辑。NVIDIA 提供一侧:处理器、系统、编译器和库。外部开发者提供另一侧:应用、框架、科学代码和专业知识。当有用的软件已经存在时,用户更愿意购买硬件。当许多用户和机器可用时,开发者更愿意瞄准平台。任何一方都不需要中央规划,循环就会复合。
黄的战略成就是在第一次应用分散在研究领域时,让 NVIDIA 保持对这个循环的承诺。一个习惯于通过单位和基准胜利来衡量产品的芯片公司,必须将其他人编写的软件视为产品价值的一部分。它还必须支持那些项目可能需要多年才能成为大市场的开发者。
优化化学库或大学课程的回报不一定会出现在与支出相同的季度。
承诺随着时间变得更加广泛。NVIDIA 2026 财年的 Form 10-K 称其技术堆栈从 CUDA 开始,然后添加了数百个特定领域的库、框架、算法、软件开发工具包和编程接口。该文件描述了一个统一的可编程架构,通过 NVIDIA、合作伙伴和第三方开发者构建的不同软件堆栈服务于多个市场。这是平台模型的正式公司描述,而不仅仅是会议舞台上的口号。
NVIDIA 的时间线现在称超过 400 万开发者创建了数千个加速应用,超过 4 万家公司使用其 AI 技术,1.5 万家初创公司参与其 Inception 计划。这些是公司报告的生态系统计数,因此不应被视为活跃使用或经济依赖的审计测量。它们仍然揭示了 NVIDIA 选择计算什么。该公司将开发者和应用作为运营资产与硅片并列呈现。
在 AI 成为头条之前,科学提供了公开证明
科学计算并不是 CUDA 等待机器学习时的装饰性边缘市场。它提供了测试平台论点的高要求工作负载和可见机构。模拟、成像和线性代数包含丰富的并行工作,但它们也暴露了数值、内存和扩展限制。一个未能产生可重复科学结果或无法在大型系统上运行的平台,仅凭其芯片在游戏中的快速速度是无法获得信誉的。
最清晰的成果之一是橡树岭国家实验室的 Titan。橡树岭领导计算设施将 Titan 描述为 Cray XK7,拥有 18,688 个计算节点,每个节点结合了 16 核 AMD Opteron CPU 和 NVIDIA K20X GPU。该系统提供超过 27 petaflops 的理论峰值性能。
橡树岭称它以其前身 Jaguar 十倍的速度和五倍的能效交付,同时仅使用略多的能量和相同的物理占地面积。
Titan 并没有证明 GPU 应该运行每个科学代码。其混合设计几乎证明了相反的情况:CPU 和 GPU 可以分工。应用程序必须暴露足够的并行性才能使用加速器,科学团队必须为不同的架构准备代码。因此,采购使生态系统决策变得具体。一个国家实验室愿意将庞大的机器与依赖于加速器软件的程序和应用工作配对。
规模也改变了谁承担采用成本。在桌面上,一个开发者可以用显卡进行实验。在 Titan 上,实验室、应用团队、系统供应商和 NVIDIA 必须协调。移植和优化主要科学代码需要培训和持续工程。这个负担是 CUDA 历史的一部分,而不是脚注。平台采用在变得方便之前是昂贵的。
可观察的结果是一台工作的混合超级计算机,一直服役到 2019 年。橡树岭将更快的解决问题时间、更大的模型复杂性和改进的模拟真实性归因于该架构。这些是该设施对其自身系统的结论,但节点数、GPU 型号、峰值性能和退役日期提供了具体的锚点。CUDA 已经从个体实验转移到用户依赖其进行计划科学工作的基础设施。
科学也影响了平台本身。具有不规则内存访问、稀疏数据、归约或多个 GPU 的算法将 CUDA 推向了简单的像素级并行之外。库和编程功能是为处理更广泛的模式而开发的。这是选择平台而非一次性加速器的一个好处:外部应用揭示了下一个版本必须支持的内容。
结果不能仅归功于黄。橡树岭选择并操作了机器;Cray 集成了系统;AMD 提供了 CPU;NVIDIA 团队构建了硬件和软件;科学家调整了他们的应用程序。黄可问责的贡献是让公司足够长期地专注于加速计算,以使这样的联盟变得可行。
AlexNet 改变了商业重心
2012 年的 AlexNet 结果通常被压缩成一个故事,即 NVIDIA“导致”了现代 AI。实际结果既更具体也更具信息量。Alex Krizhevsky、Ilya Sutskever 和 Geoffrey Hinton 在 ImageNet 上训练了一个深度卷积神经网络。他们的论文称训练花费了五到六天,使用两块各有 3GB 内存的 NVIDIA GTX 580 GPU。
链接的实现叫做 cuda-convnet。在 2012 年的比赛中,基于他们方法的集成实现了 15.3% 的前五名测试错误率,而第二名的成绩是 26.2%。
这些数字确定了一个结果,而不是单一原因。研究人员设计了网络、训练方法和多 GPU 方案。ImageNet 提供了一个大型标记数据集。神经网络方法的进步很重要。GPU 使得计算量在几天内可行,而 CUDA 提供了一种编程方式。移除其中任何一个元素,历史都会改变。
将功劳全给 NVIDIA 会抹杀研究;将处理器视为偶然会忽略论文自身对内存和训练时间的描述。
对于黄,AlexNet 是比早期零散应用更强的信号,因为它指向了一个具有扩展计算需求的通用方法。神经网络可以随着模型和数据集的增长而改善,而训练暴露了大量的并行线性代数。工作负载的胃口与 GPU 的架构以及 NVIDIA 多年的软件投资相一致。
CUDA 意味着该公司不必在突破出现后才开始构建开发者环境。环境已经存在。
这就是耐心成为战略期权价值的地方。2012 年之前,CUDA 支持的科学和技术领域的市场有意义但碎片化。AlexNet 之后,同一基础可以服务一个快速增长的学习社区。一个仅为某个化学包或成像算法构建的平台不会如此轻易地转移。CUDA 的通用抽象和库给了 NVIDIA 从一个应用浪潮到另一个的路径。
NVIDIA 的公司时间线将 AlexNet 识别为由其 GPU 驱动的 2012 年里程碑。该描述是宣传性的,应与原始论文一起阅读。论文提供了可验证的硬件、训练和错误率细节;时间线显示了 NVIDIA 如何解读这一事件。该公司看到的不是两张游戏卡片的幸运销售,而是加速计算可能成为主要软件过渡引擎的确认。
商业反应扩展到了原始 CUDA 语言之外。NVIDIA 开发并收购了用于神经网络操作的库,构建了训练系统,添加了专用硬件特性,并支持了让研究人员在更高级别工作的框架。原始决策的价值不在于每个 AI 开发者都会编写原始的 CUDA 内核。而在于框架作者和库团队可以瞄准 CUDA,使得数百万用户通过抽象层受益。
框架集成使平台变得普通
当许多用户依赖一项技术而不与其最底层交互时,该技术就变成了基础设施。当代机器学习开发者通常用 Python 而不是 CUDA C++ 编写张量操作。然而,框架可能将这些操作分发到 CUDA 库和内核。用户看到一个张量和一个设备名称;平台在下面处理编译、内存分配、调度和优化的原语。
PyTorch 使这种关系明确。其 CUDA 语义文档解释了 CUDA 张量如何分配给设备,流如何排序工作,多个 GPU 如何通信,以及设备无关代码如何在 CPU 和 CUDA 执行之间选择。框架减少了研究人员必须编写的平台特定代码量,但它没有抹去平台。当性能、内存或同步重要时,CUDA 概念仍然可见。
TensorFlow 提供了另一个独立信号。其安装指南提供了包含 CUDA 支持的 GPU 包路径,并列出了支持的 GPU 配置所需的 NVIDIA 驱动程序、CUDA Toolkit 和 cuDNN。同样,大多数用户不实现卷积核。框架和库维护者承担了这项工作,他们的支持使 NVIDIA 硬件可以被更广泛的人群访问。
这种分层以两种方式加强了 CUDA。首先,一小群专家维护者可以优化由大量应用程序使用的操作。更快的矩阵乘法或注意力核可以改进许多模型,而无需每个团队重写。其次,框架成为硬件平台的分发渠道。在一个 CUDA GPU 上学习框架的学生可以将类似代码带到工作站、云实例或集群。
同一分层可以在应用层面削弱直接依赖。针对高级框架编写的代码也可能在 CPU、AMD GPU、Apple 处理器、Google 加速器或其他后端上运行。设备无关的 API 为竞争创造了空间。但语法的可移植性不等于性能的可移植性。自定义 CUDA 扩展、对内存的假设、不支持的操作和平台调优的内核仍然可能使迁移代价高昂。
这种紧张关系是黄的平台结果的核心。当高级工具使 CUDA 易于采用时,NVIDIA 受益;当这些工具使底层硬件可互换时,它面临风险。该公司的回答是不断添加优化的库、系统特性和开发者服务,以使抽象框架在其堆栈上运行得特别好。因此,竞争竞赛发生在 Python 接口之下,与在芯片规格表上一样多。
兼容性将过去的代码变成了购买下一个 GPU 的理由
开发者生态系统只有在昨天的工作保留价值时才会积累。如果每个新处理器都迫使应用程序从头重建,库和技能将迅速贬值。因此,NVIDIA 的兼容性设计既是经济特性,也是技术特性。
当前的 CUDA 平台文档解释了更高级别的代码可以编译为 PTX,一种驱动程序可以为物理 GPU 进行翻译的中间表示。可执行文件可以携带多种架构的二进制文件以及为未来架构准备的 PTX。文档称 PTX 可以在运行时为后来的计算能力进行编译,而二进制兼容性适用于定义的架构边界内。这些承诺有局限性,但它们为开发者提供了跨代的支持路径。
兼容性改变了购买行为。一个拥有工作 CUDA 应用程序、训练有素的员工和部署工具的组织可以将新的 NVIDIA GPU 视为延续,而不是全新的软件项目。新硬件可能仍然需要调优以达到其最佳性能,旧的二进制文件可能不会使用新特性。但运行现有工作的前景降低了采用风险。每个硬件世代可以继承先前软件投资创造的需求。
它也改变了 NVIDIA 的义务。平台供应商不能只为新的基准进行优化而放弃旧应用程序而不承担后果。驱动程序必须在承诺的边界内加载旧代码。库必须管理弃用。文档必须解释哪些工具包、驱动程序和 GPU 的组合得到支持。兼容性层中的错误可能影响公司从未编写的应用程序。生态系统之所以是资产,正因为它也是维护负担。
这有助于解释为什么 CUDA 变得比单个快速芯片更具防御性。硬件性能可能被竞争对手超越或被专用加速器替代。一个由兼容应用程序、库和运营知识组成的整体移动得更慢。竞争对手必须提供足够的利益,以证明不仅购买硬件,而且迁移、验证和再培训的合理性。
这种优势并非永久。兼容性本身可能变得笨拙,抽象层可以减少平台差异。云服务让客户租用替代品,而无需购买新集群。开放标准可以使代码可移植。然而,CUDA 的长期连续性意味着比较很少是在两个空白系统之间进行的。一方通常带着多年积累的工作出现。
NVIDIA 的财务结果显示了规模,而非 CUDA 收入线
最可见的商业结果是 NVIDIA 从以图形为中心的芯片供应商转变为数据中心计算系统和软件的供应商。其 2026 财年文件报告收入为 2159.38 亿美元,比 2025 财年增长 65%。计算和网络贡献了 1934.79 亿美元,而图形为 224.59 亿美元。数据中心收入同比增长 68%,公司将其归因于加速计算和 AI 平台转移。
这些数字非同寻常,但它们并未单独衡量 CUDA。NVIDIA 销售 GPU、网络、系统、服务和一些软件。客户需求也反映了模型增长、云资本支出、内存供应、制造能力、网络性能和近期架构的特性。CUDA 帮助使系统有用,但该文件不允许局外人计算如果没有它会有多少美元消失。
正确的说法更窄:NVIDIA 声明的战略及其最大的收入板块现在依赖于一个完整的计算平台,其基础包括 CUDA。10-K 表示公司结合了硬件、系统、软件、算法、库、模型、数据集和服务。它还表示一个庞大且不断增长的开发者基础和安装基础增加了平台的价值。管理层明确将网络效应描述为商业模式的一部分。
投资提供了另一个可测量的结果。NVIDIA 报告 2026 财年研发费用为 184.97 亿美元,比上年增长 43%。它表示其 42,000 名员工中约有 31,000 人从事研发工作,自成立以来在该职能上的累计投资超过 767 亿美元。这些总额涵盖了整个公司,而非仅 CUDA。
它们显示了现在维持共享架构及其众多软件堆栈的组织规模。
规模也带来了集中度和执行风险。该文件称一个直接客户占 2026 财年收入的 22%,另一个占 14%,主要在计算和网络领域。平台可以多样化使用案例,而销售仍然集中在系统构建者和云提供商手中。CUDA 广泛的开发者覆盖并不意味着 NVIDIA 直接向数百万开发者开具发票,或购买力均匀分布。
因此,财务结果支持平台故事,而没有证明简单的因果方程。黄的决策给了 NVIDIA 一种持久的方式来扩展其处理器能做的事情。AI 需求、工程执行、供应伙伴关系和外部创新将该期权转化为收入。严格的评估可以将 CUDA 视为基础性的,同时拒绝将每一美元标为“CUDA 收入”。
护城河是有用的软件——以及离开它的成本
人们经常将 CUDA 描述为护城河。这个比喻是不完整的,除非它解释了水里有什么。障碍不仅仅是 CUDA 是 NVIDIA 控制的编程环境。它是经过调优的库、工作应用程序、文档、员工专业知识、调试实践、兼容性和可用硬件的组合价值。当这种组合节省更多时间或产生比替代方案更好的结果时,客户留下,而不是因为一个名字就阻止了移动。
OECD 2025 年关于 AI 基础设施竞争的论文将软件描述为使 GPU 有效的关键,并引用了一个估计,即 NVIDIA 在 AI 使用的 GPU 中持有超过 80% 的市场份额。它将公司的地位与性能、先发优势和 CUDA 联系起来。
该百分比是 OECD 使用的次级市场估计,而非官方出货量普查,因此应视为集中度的指示,而非精确的通用份额。
后来的 OECD 竞争圆桌会议摘要描述了 NVIDIA GPU 和 CUDA 之间的间接网络效应:更多的软件使硬件有吸引力,而更广泛的硬件采用鼓励更多软件。它还记录了担忧,即对开发环境的依赖可能使切换在技术上困难且成本高昂,有时需要软件重新设计和时间。同时,讨论将市场描述为潜在可竞争的,因为其他芯片制造商、云提供商和 AI 开发者在追求替代方案。
这种平衡的描述比将每个依赖称为滥用或将每种优势称为应得更更有用。CUDA 创造了效率:开发者可以重用优化过的代码,组织可以雇佣具有相关技能的人,框架维护者可以瞄准稳定的平台。这些好处是生态系统拥有力量的原因。相同的重用可能成为当买家想要不同加速器时的转换成本。
成本因工作负载而异。一个仅使用多个后端上可用的高级框架操作的应用程序可能只需要有限的代码更改即可移动,尽管性能和部署仍需测试。一个包含多年自定义 CUDA 内核和 NVIDIA 特定库的科学代码可能需要重大工程。一个已经自动化 CUDA 集群的公司也可能需要新的监控、调度和调试实践。
“被锁定”不是二元状态;它是一堆迁移成本。
因此,黄的决策可以同时从两个角度评估。从 NVIDIA 的角度来看,累积的开发者投资使每一代产品更有价值,且不易受到竞争对手芯片发布的影响。从客户的角度来看,生态系统可以降低今天构建的成本,同时提高明天更换供应商的成本。两者都是同一平台成功的结果。
竞争对手攻击编程成本,而非仅仅是芯片
可移植性工具的存在表明竞争对手理解优势所在。AMD 的 HIP 文档描述了一个 C++ 运行时和内核语言,旨在让同一源代码瞄准 AMD 和 NVIDIA GPU。其移植材料解释了开发者如何逐步转换 CUDA 代码,并与原始代码进行功能和性能比较。
迁移路径的存在本身就确认了两件事:CUDA 代码有足够的价值需要保留,并且移动它是一个值得工具化的问题。
Khronos 采取了基于标准的路线。SYCL 是一个开放的、免版税的、跨平台 C++ 抽象,用于包括 CPU、GPU 和 FPGA 在内的异构处理器。其文档小心地界定了边界:通用语言和 API 可以使代码可移植,但它不能保证自动和完美的性能可移植性。开发者仍可能需要特定于架构的变体和调优。
这些替代方案阻止了一个确定性的故事,即 CUDA 必须永远主导。高级框架越来越多地支持多个设备。云平台可以暴露竞争加速器。大买家可以为特定工作负载构建定制芯片。开放编程标准可以减少绑定到单一供应商的代码量。推理工作负载可能奖励与大型训练系统不同的成本和能源权衡。
然而,可移植性层必须与成熟度竞争,而不仅仅是语法。翻译的内核必须正确。库必须涵盖所需的操作。性能工具必须识别瓶颈。部署必须稳定。文档和社区知识必须回答边缘情况。应用程序必须在源平台和目标平台同时变化时保持工作。这就是为什么软件生态系统即使当竞争对手的处理器能力很强时也难以快速复制。
竞争也可以改进 CUDA。如果客户可以移动,NVIDIA 必须通过性能、可靠性和开发者生产力来赢取采用。如果替代方案缩小了库的差距,该公司不能仅仅依赖历史代码。平台必须继续吸收新的模型、数值格式、内存系统和多 GPU 模式。停止进化的护城河变成了孤岛。
政策问题不在于专有平台是否可能成功。而在于围绕这种成功的行为是否不公平地阻挡替代方案、限制互操作性或以有害方式捆绑相邻市场。OECD 材料将这些确定为持续审查的事项,而非 CUDA 本身非法的认定。可观察的事实是,软件和硬件足够强烈地相互加强,以塑造市场结构。
地缘政治可以分裂曾经因规模而统一的生态系统
CUDA 早期的提议是广泛的可用性:开发者可以学习一个模型,并在消费级卡、工作站和服务器上的 NVIDIA 硬件上运行它。出口管制和区域技术政策使这一提议复杂化。NVIDIA 2026 财年的文件称,限制实际上已将其从中国的数据中心计算市场中排除,并警告说排除可能帮助竞争对手建立更大的开发者和客户生态系统。
这一警告揭示了 NVIDIA 如何重视市场准入。失去的销售不仅是一个单位。它可能是一个学习另一个工具链的开发者,一个教授不同平台的大学,一个优化替代方案的云,以及一个不再将 CUDA 视为默认的应用程序。生态系统竞争在双向复合。
这并不证明任何特定的出口政策是对还是错。国家安全决策权衡公司收入和软件采用之外的因素。它确实显示了黄的平台战略的一个限制:没有私人公司控制其硬件到达开发者所经过的所有司法管辖区、供应链或规则。当一个全球统一的编程基础在访问底层设备时碎片化,它也可以碎片化。
供应是另一个限制。CUDA 无法在没有处理器、内存、封装、电源、网络和数据中心容量的情况下提供加速。NVIDIA 设计其主要芯片,但依赖制造合作伙伴。最近的平台已从 GPU 卡扩展到完整系统,其部件必须协同工作。软件增加了稀缺硬件的有用性;它无法制造更多硬件。
客户集中度创造了另一个依赖。大型云提供商将 CUDA 容量分发给许多用户,但它们也可以开发自己的加速器并推广替代框架。NVIDIA 的平台帮助云销售计算服务,而云调节对 NVIDIA 产品的访问。生态系统不是单向锁。主要客户可以影响定价、部署和竞争架构选择。
这些约束使领导故事保持 grounded。黄的决策产生了杠杆,而非无敌。公司必须维护软件、发货硬件、应对法规并说服每一代新开发者。平台过去的采用买来了时间和分发;它不能取消执行风险。
功劳属于领导、工程师和用户,比例不同
2026 年 IEEE 荣誉勋章提供了一个有用的外部表述。IEEE Spectrum 称黄因在 GPU 及其在科学计算和 AI 应用中的领导地位而获得认可。“领导”一词很精确。它识别了技术愿景和组织方向,而不声称他个人创作了每个组件。
在 CUDA 故事中,黄有文件支持的最强行动是模式识别、承诺和平台框架。他将非图形用途视为共同计算需求的证据。他支持统一的可编程架构。当公司通过科学计算和 AI 发展时,他使软件和开发者采用保持核心。他还公开将 NVIDIA 描述为平台而非组件供应商,这一描述现在与其监管文件一致。
工程师的贡献是系统本身。Buck 和 Brook 团队提供了重要的研究谱系。Nickolls、Buck、Garland、Skadron 和许多同事定义并解释了早期模型。编译器、驱动程序、库、架构和开发者关系团队将发布变成了一个维护环境。框架作者、研究人员和应用开发者将 CUDA 扩展到 NVIDIA 无法单独构建的领域。
用户提供了决定性的测试。医学成像和化学提供了早期信号。科学家暴露了规模和数值需求。AlexNet 团队展示了一个改变行业优先级的机器学习结果。PyTorch 和 TensorFlow 维护者通过广泛使用的框架使 GPU 执行可及。然后客户决定整个系统是否证明其成本合理。
分离这些角色改进而非削弱黄的记录。行政领导之所以有价值,不是因为模仿工程。而是当它选择了一个让工程和外部创新复合的方向时才有价值。可验证的结果是一个组织,它使一个编程架构在几次计算浪潮中保持相关。
它也使得问责更清晰。黄可以因战略承诺而获得赞誉,并对平台行为、投资优先级和市场主张负责。技术团队可以因实施而获得赞誉。研究人员保留其发现的作者身份。客户可以判断平台的收益是否超过其成本。英雄故事模糊了这些界限;平台故事需要它们。
长期赌注的实用记分卡
2006 年发布二十年后,CUDA 决策可以对照几个可观察的结果进行测试。
首先,编程模型是否比其发布硬件更长寿?是的。当前的 CUDA 文档处理现代多 GPU 系统,同时保留内核、线程层次结构和异构执行的核心概念。兼容性机制在规定的限制内为应用程序提供了跨代的路径。
第二,开发者是否在图形之外使用它?是的。早期技术文献记录了化学、成像、线性代数和物理。Titan 使 GPU 加速成为大型国家实验室系统的一部分。AlexNet 使用了两块 NVIDIA GPU 和一个 CUDA 实现用于图像分类的里程碑式结果。当前的 PyTorch 和 TensorFlow 文档将 CUDA 暴露为支持的执行路径。
第三,是否形成了补充生态系统?NVIDIA 称超过 400 万开发者现在构建加速应用,并在其财务文件中描述了数百个库、框架、算法和开发接口。公司计数背后的确切活动不是公开的,但独立的框架文档确认 CUDA 嵌入在广泛使用的软件层中。
第四,平台是否支持了更大的业务?NVIDIA 的计算和网络收入在 2026 财年达到 1934.79 亿美元,远远超过其图形板块。公司将加速计算和 AI 识别为数据中心增长的驱动因素,并将 CUDA 置于其堆栈的基础。没有披露隔离 CUDA 的因果份额,因此结果是在声明战略内的关联,而非独立的软件收入计算。
第五,战略是否创造了防御性?OECD 描述了高度集中的 AI GPU 市场,并将 CUDA 与网络效应和转换成本联系起来。AMD HIP 和 SYCL 的存在部分是为了降低这些成本。在可移植性上的持续投资本身就是安装的软件基础在竞争上重要的证据。
第六,是否有未解决的成本?是的。迁移可能昂贵,平台集中度可能减少买家选择,兼容性需要持续维护,全球访问可能因监管和供应限制而中断。替代硬件和编程模型使市场保持可竞争性。成功的平台决策既创造了义务也创造了回报。
这个记分卡避免了两个错误。一个是事后确定:CUDA 后来的成功并不意味着其早期市场是保证的。另一个是创始人神话:战略连续性并不使黄成为许多人产生的技术工作的唯一创造者。持久的成就是领导、架构、软件和外部采用的一致性。
持久的决策是补贴他人的发明
CUDA 最深的战略效果是使 NVIDIA 硬件成为他人可以创造价值的地方。科学家可以加速模拟,框架团队可以优化张量操作,初创公司可以部署模型,云可以销售对结果系统的访问。NVIDIA 不需要发明每个应用。它需要使下一个应用更可能选择其平台。
这改变了半导体公司的性质。产品在芯片通过验证时不再完整。它直到编译器、库和应用使硅变得有用时才完成,并且如果下一个软件浪潮在其他地方形成,它仍有风险。开发者关系、兼容性和教育成为战略功能。时间范围延伸到一个硬件周期之外。
黄的长期赌注成功了,因为它将真正的架构优势与那个更长的时间范围结合起来。GPU 有为图形创建的并行吞吐量。研究人员已经表明其他问题可以使用它。CUDA 降低了编程障碍。库和框架拓宽了访问。兼容性保留了积累的工作。每一层使下一层更有价值。
相同的结构解释了当前关于依赖的辩论。当一个平台节省了开发者数年的工作,离开它可能花费数年。客户受益于生态系统并暴露于其所有者。竞争对手必须匹配体验,而不仅仅是基准。监管者在同一组事实中看到了潜在的效率和潜在的障碍。
最公平的结论既不是 CUDA 单独创造了 AI,也不是 NVIDIA 恰好卖了正确的芯片。黄在面对不确定需求时做出了早期、持续的平台决策。NVIDIA 工程师和学术前辈构建了编程模型及其机制。研究者和开发者证明了它能做什么。
由此产生的生态系统帮助将 GPU 从图形组件转变为通用计算平台——并给了 NVIDIA 其最强的战略资产和其最大的责任之一。

