要約

Huang の戦略的貢献は、NVIDIA GPU を中心とした汎用 Computing Platform を支援したことであり、CUDA のアーキテクト、コンパイラチーム、ライブラリ作成者、外部研究者のエンジニアリング作業を自分のものと主張したことではありません。

CUDA は GPU コンピューティングにおける中心的な障壁を低減しました。開発者は、すべての計算をグラフィックス操作として偽装する代わりに、C のようなモデルを通じて並列処理を表現できるようになりました。

初期の科学的利用、GPU 加速された Titan スーパーコンピュータ、そして AlexNet は、同じプログラム可能なアーキテクチャがゲーム以外の重要なワークロードをサポートできるという、ますます強力な証拠を提供しました。

NVIDIA は、ライブラリ、ドキュメント、トレーニング、フレームワーク統合、ハードウェア世代間の互換性を通じて優位性を拡大しました。同社は現在、CUDA を完全なコンピューティングスタックの基盤と位置付けています。

商業的な結果は重要ですが、分離可能ではありません。NVIDIA は2026会計年度に2159億ドルの収益を報告しましたが、CUDA の収益は独自の項目として開示されていません。同社の成長をソフトウェアのみに帰することは誤りです。

エコシステムは実際の顧客価値と実際のスイッチングコストを生み出します。AMD の HIP とクロスプラットフォーム SYCL 標準は移植性が可能であることを示していますが、移行には依然としてコード変更、パフォーマンスチューニング、新しい運用知識が必要となる場合があります。

この決定はグラフィックスの機能を超えたものだった

NVIDIA の歴史の最も単純なバージョンは、より良いゲームグラフィックスから人工知能へと、あたかも一つの市場が自然に次の市場へと流れていったかのように進みます。より有用なバージョンは、誰がプロセッサをプログラムできるのか、そしてプロセッサはどのような作業を受け入れるべきなのかという決定に焦点を当てています。

NVIDIA は、何百万ものピクセルをレンダリングするには類似した計算の同時実行が有効であるため、高度に並列なデバイスを構築しました。CUDA は、その並列機構がグラフィックスパイプラインの特殊なステージにとどまるのではなく、汎用コンピューティングのターゲットになり得るかどうかを問いました。

それは明白な製品拡張ではありませんでした。グラフィックス向けに設計されたチップは、すでにグラフィックスインターフェースを介してプログラムすることができ、研究者はその上で印象的な非グラフィックス計算を実証していました。しかし、その方法は厄介でした。彼らはしばしばデータをテクスチャに、計算をレンダリング操作に変換しなければなりませんでした。

分子動力学や医用画像に興味がある科学者は、その下にある演算能力に到達する前に、グラフィックスシステムに属する概念を理解しなければなりませんでした。生のスループットは存在しましたが、広く利用可能な Computing Platform はありませんでした。

この区別は Huang を評価する際に重要です。彼の役割は、すべてのコンパイラパスを記述したり、すべての同期ルールを定義したりすることではありませんでした。NVIDIA 自身の経歴によると、彼は1993年の共同創設者であり、社長兼 CEO として継続的に務めてきました。

したがって、プラットフォームの決定は彼の経営記録に属します。彼は、短期的な規模が不確かな市場に対して、資本、製品の優先順位、組織の注意を向けることができました。技術的な実装は、はるかに多くのグループに属します。

NVIDIA の企業年表は、CUDA アーキテクチャの発表を2006年とし、その目的は GPU 並列処理を科学と研究に開放することだったと述べています。John Nickolls、Ian Buck、Michael Garland、Kevin Skadron による2008年の技術論文は、CUDA ソフトウェアが2007年にリリースされたと述べています。これらの日付は矛盾ではなく、異なるマイルストーンを表しています。アーキテクチャは2006年後半に NVIDIA の統合グラフィックス・コンピューティング方向性とともに登場し、その後開発環境がプログラマーに届きました。

これは製品のアイデンティティの戦略的拡大でした。GPU が単なるグラフィックスアクセラレータに留まれば、需要は主にビジュアルワークロードに結びついたままでした。もしプログラム可能な並列プロセッサになれば、適切な計算集約型の問題すべてが購入の理由になり得ました。同社は、有用なアプリケーションが作成可能であること、コードがハードウェアのアップグレードを生き残れること、十分な数の開発者が異なるコンピューティングスタイルを受け入れることを証明する必要がありました。したがって、CUDA は開発者がまだ創造していない市場に関する約束でした。

研究者はすでに機会と摩擦を明らかにしていた

汎用 GPU コンピューティングは NVIDIA の発表イベントで始まったわけではありません。学術研究者やプログラマーは何年も前からそれを探求していました。Ian Buck による2004年のスタンフォード大学の博士論文「Stream Computing on Graphics Hardware」は、C にデータ並列概念を拡張し、GPU をストリーミングコプロセッサとして抽象化するコンパイラおよびランタイムシステム Brook を紹介しました。

この論文では、グラフィックスプロセッサがなぜ魅力的だったかが説明されています。データ並列性と演算集約性により、繰り返し計算にかなりのハードウェアを割り当てることができたからです。また、メモリ制約、カーネルオーバーヘッド、汎用アルゴリズムをレンダリングデバイスにマッピングする難しさなど、旧来の方法のコストも文書化されています。

Brook は、創業者中心の起源神話を防ぐために重要です。Buck の研究は、Tim Foley、Daniel Horn、Jeremy Sugerman、Kayvon Fatahalian、Mike Houston、Pat Hanrahan の研究とともに、より高レベルのプログラミングシステムによって、すべてのプログラマーがグラフィックスプリミティブを操作しなくても GPU を利用できることを実証しました。

スタンフォードのプロジェクトページによると、この研究はより大きなストリームコンピューティング研究コミュニティの中に位置づけられ、NVIDIA を含む複数の企業や公的機関から支援を受けていました。CUDA が製品になる前から、アイデアは既に制度の境界を越えて広がっていました。

NVIDIA は、同社のGPU プログラミングの歴史に関する説明によると、2004年に Buck を採用しました。そのページでは、Brook を CUDA の先駆けと呼び、目的は C プログラマーに馴染みのあるアプローチを作りながら、より高レベルの並列概念を追加することだったと述べています。後の CUDA 論文では、NVIDIA の Nickolls、Buck、Garland に加え、バージニア大学の Skadron が名を連ねています。これらの情報源は技術的な系譜とチームを示しており、Huang が CUDA の唯一の発明者であるとする主張を支持していません。

Huang 自身の貢献は、散在する利用例をどのように解釈したかによく表れています。2024年のスタンフォード経営大学院での対談で、彼は NVIDIA がプロセッサを段階的にプログラム可能にし、Cg 言語を開発し、研究者が CT 再構成や計算化学にこの技術を利用していることに気づいたことを回想しています。彼は医療ユーザーを訪問し、それらの例を、この形態のコンピューティングが従来の機械ではうまく処理できなかった問題を解決できるシグナルとして扱ったと述べています。彼の説明では、それぞれの利用によって会社は継続への自信を深めていきました。

この回想は参加者による説明であり、完全な機関の歴史ではありません。その戦略的価値は、それが明らかにする意思決定ルールにあります。NVIDIA は「GPU コンピューティング」と呼ばれる大規模で整然とした市場が現れるのを待ちませんでした。同社は技術的に信頼できるエッジケース(画像処理、素粒子物理学、流体シミュレーション、化学)に注目しました。これらはコンシューマーグラフィックスと比較すると小規模でしたが、大量の並列数値処理という共通の構造を持っていました。Huang は別々のアプリケーションの背後に共通のプラットフォーム機会を見出しました。

賭けは確実ではないものの、証拠に基づいていました。既存の研究は GPU が適切な計算を高速化できることを示していました。しかし、主流の開発者がソフトウェアの書き方を変えること、科学者がゲーム由来のプロセッサを信頼すること、NVIDIA がツールチェーンを世代間で維持できることを証明したわけではありません。この決断は、有望な研究方向を長期的な製品義務に変換しました。

CUDA はプログラム可能性の単位を変えた

CUDA の技術的重要性は、魔法として扱わなくても説明できます。2008年の ACM Queue 論文は、スレッドグループの階層、共有メモリ、バリア同期という3つの中核的抽象化を提示しています。プログラマーはカーネル(並列実行する関数)を記述し、その作業の多くのインスタンスをブロックとグリッドに編成します。ブロック内のスレッドは共有メモリと同期を通じて協調でき、ブロックはランタイムが利用可能な処理ユニットに分散できるように設計されています。

この構造は、しばしば相反する2つの目標を結びつけました。プログラマーはメモリ階層と並列ハードウェアを効率的に使用するための十分な制御を必要としていました。NVIDIA は、アプリケーションを単一の物理コア数にハードコーディングすることなく、ソフトウェアがある GPU 世代から別の世代にスケールできるようにする必要がありました。開発者に問題を独立したブロックに分割するよう求めることで、CUDA はランタイムが同じプログラムを異なる数のプロセッサでスケジュールできるようにしました。この抽象化はすべてのアルゴリズムを並列化したわけではなく、パフォーマンス作業の必要性を排除したわけでもありません。ただし、プログラムの論理的分解とその下にある GPU コアの正確な数を分離しました。

この変化は、インターフェースを開発者の問題により近づけるものとして理解できます。適切な計算モデルが登場する前は、プログラマーは数値をテクスチャとしてエンコードし、レンダリング操作を起動し、結果をあたかもピクセルであるかのように取得していました。CUDA を使用すれば、プログラマーはカーネル、配列、メモリ転送、同期を直接表現できました。ハードウェアは依然として制約を課しました。分岐パターン、メモリアクセス、データ移動、演算強度によって、高速化が価値があるかどうかが決まる可能性がありました。しかし、それらの制約はグラフィックス語彙から構築された偽装ではなく、コンピューティングの概念になりました。

プログラミングモデルはまた、GPU を明示的にヘテロジニアスにしました。CPU はホストのまま、アプリケーションを開始し、データを準備し、作業を起動しました。GPU はデバイスとなり、多数の並列スレッドを実行しました。現代のCUDA ドキュメントは、複数の CPU と GPU を備えたシステムを許容しながら、その関係を今でも説明しています。CUDA は GPU が CPU をすべての点で置き換えるべきだと主張したわけではありません。開発者がワークロードの異なる部分をそれらに適した種類のプロセッサに割り当てる方法を提供しました。

その境界が、プラットフォームが広がることができた理由の1つです。企業や研究所は既存のアプリケーションを破棄してすべての行を書き直す必要はありませんでした。高価なカーネルを特定し、それらの部分を GPU に移し、シリアルまたは制御主体の作業を CPU に残すことができました。採用は1つのボトルネックから始めることができました。開発環境、展開プラクティス、スタッフの知識が整えば、さらに多くの作業が続く可能性がありました。

限界も同様に重要です。高速化はアプリケーション、実装、比較システム、転送されるデータ量に依存します。初期の CUDA 論文では、分子動力学で10〜100倍の改善から、特定の MRI や n 体実装ではるかに高い数値まで、さまざまな例が報告されていました。これらの測定値はテストされたシステムでの可能性を示しましたが、GPU に移されたプログラムすべてに対する普遍的な約束ではありませんでした。プラットフォームは、1つの倍率を保証するのではなく、適切な高速化の検索を反復可能にすることで採用を獲得します。

製品は補完物を通じてプラットフォームになった

コンパイラだけでは CUDA エコシステムは生まれなかったでしょう。開発者には、ドライバ、デバッガ、プロファイラ、ドキュメント、コード例、数学ライブラリ、教材、コミュニティサポート、いくつかの価格帯で利用可能なハードウェアが必要でした。各補完物は異なる採用コストを削減しました。ライブラリは高度にチューニングされたプリミティブを記述する必要性を排除でき、プロファイラはカーネルが停止した理由を示せ、コースは並列思考を教えやすくし、互換性ポリシーによりチームは動作するアプリケーションを破棄することなく新しい GPU を購入できました。

2008年の論文はすでに、計算化学、疎行列解法、ソート、検索、物理学における CUDA プログラムを紹介し、大学の教育にも言及していました。これらの初期のアプリケーションは、直接的なソフトウェア収益をほとんど生み出さなかったとしても重要でした。他の開発者にコピーする例を提供し、ツールを改善する質問を生み出し、次の雇用主も CUDA を選択するかもしれないスペシャリストを育成しました。成功したアプリケーションごとに、本来の作成者以外の誰かに対するハードウェアの有用性が高まりました。

これが開発者プラットフォームの経済論理です。NVIDIA は一方の側面(プロセッサ、システム、コンパイラ、ライブラリ)を提供します。外部の開発者は別の側面(アプリケーション、フレームワーク、科学コード、専門知識)を提供します。ユーザーは有用なソフトウェアが存在する場合、ハードウェアを購入する意欲が高まります。開発者は多くのユーザーとマシンが利用可能な場合、プラットフォームをターゲットにする意欲が高まります。このサイクルが複合するために、どちらかの側が中央で計画される必要はありません。

Huang の戦略的成果は、最初のアプリケーションが研究分野に分散していたときにも、NVIDIA をこのサイクルに留めておいたことです。製品をユニット数とベンチマーク勝利で測定することに慣れたチップ企業は、他の人々によって書かれたソフトウェアを製品の価値の一部として扱わなければなりませんでした。また、プロジェクトが大市場になるまでに何年もかかるかもしれない開発者を支援しなければなりませんでした。最適化された化学ライブラリや大学のコースからの見返りは、費用と同じ四半期に現れるとは限りませんでした。

コミットメントは時間とともにより広範囲になりました。NVIDIA の2026会計年度Form 10-Kは、同社のテクノロジースタックが CUDA から始まり、その後、数百のドメイン固有ライブラリ、フレームワーク、アルゴリズム、ソフトウェア開発キット、プログラミングインターフェースが追加されると述べています。この提出書類は、NVIDIA、パートナー、サードパーティ開発者によって構築された異なるソフトウェアスタックを通じて複数の市場にサービスを提供する統一されたプログラム可能アーキテクチャを説明しています。これは、カンファレンスステージのスローガンではなく、プラットフォームモデルの正式な企業説明です。

NVIDIA の年表は現在、400万人以上の開発者が数千の高速化アプリケーションを作成し、4万社以上の企業が同社の AI 技術を利用し、1万5000のスタートアップが Inception プログラムに参加していると述べています。これらは企業報告のエコシステムカウントであり、アクティブな使用や経済的依存の監査済み測定値として扱われるべきではありません。それでも、NVIDIA が何をカウントすることを選択したかを明らかにしています。同社は開発者とアプリケーションをシリコンと並ぶ運用資産として提示しています。

科学は AI が見出しになる前に公的な証明を提供した

科学計算は、CUDA が機械学習を待っている間の装飾的なサイドマーケットではありませんでした。それはプラットフォームのテーゼをテストする要求の厳しいワークロードと可視的な機関を提供しました。シミュレーション、画像処理、線形代数には豊富な並列作業が含まれていますが、数値、メモリ、スケーリングの限界も露呈します。再現可能な科学結果を生み出せなかったり、大規模システムで実行できなかったりしたプラットフォームは、そのチップがゲームで高速だったというだけでは信頼性を得られなかったでしょう。

最も明確な成果の1つは、オークリッジ国立研究所の Titan でした。Oak Ridge Leadership Computing Facilityは、Titan を、それぞれ16コアの AMD Opteron CPU と NVIDIA K20X GPU を組み合わせた18,688の計算ノードを備えた Cray XK7 と説明しています。このシステムは、理論ピーク性能27ペタフロップス以上を提供しました。オークリッジは、わずかに多いエネルギーと同一の物理的フットプリントを使用しながら、前身の Jaguar の10倍の速度と5倍のエネルギー効率を実現したと述べています。

Titan は、GPU がすべての科学コードを実行すべきであることを証明したわけではありません。そのハイブリッド設計はほぼ逆のことを証明しました。CPU と GPU が作業を分割できるということです。アプリケーションはアクセラレータを使用するのに十分な並列性を露出する必要があり、科学チームは異なるアーキテクチャに合わせてコードを準備する必要がありました。したがって、調達はエコシステムの決定を具体的なものにしました。国立研究所が、アクセラレータソフトウェアに依存するプログラミングとアプリケーションの取り組みを大規模なマシンと組み合わせることを厭わなかったのです。

規模はまた、誰が採用コストを負担するかを変えました。デスクトップでは、1人の開発者がグラフィックスカードで実験できました。Titan では、研究所、アプリケーションチーム、システムベンダー、NVIDIA が調整する必要がありました。主要な科学コードの移植と最適化にはトレーニングと継続的なエンジニアリングが必要でした。その負担は CUDA の歴史の一部であり、脚注ではありません。プラットフォームの採用は、便利になる前に高コストです。

観察可能な結果は、2019年まで稼働し続けた動作するハイブリッドスーパーコンピュータでした。オークリッジは、アーキテクチャのおかげで解決時間の短縮、モデルの複雑さの増大、シミュレーションの現実性の向上を実現したとしています。これらは施設自身のシステムに関する結論ですが、ノード数、GPU モデル、ピーク性能、退役日は具体的なアンカーを提供します。CUDA は個々の実験から、ユーザーが計画された科学作業のために依存するインフラストラクチャへと移行していました。

科学はプラットフォーム自体にも影響を与えました。不規則なメモリアクセス、スパースデータ、リダクション、複数 GPU を持つアルゴリズムは、CUDA を単純なピクセル状の並列性を超えて押し上げました。より広いパターンを処理するためにライブラリとプログラミング機能が開発されました。これは、1回限りのアクセラレータではなくプラットフォームを選択する利点です。外部アプリケーションは、次のバージョンがサポートしなければならないものを明らかにします。

この結果は、Huang だけの功績とは言えません。オークリッジが機械を選択し運用しました。Cray がシステムを統合しました。AMD が CPU を供給しました。NVIDIA のチームがハードウェアとソフトウェアを構築しました。科学者がアプリケーションを適応させました。Huang の説明責任のある貢献は、そのような連立が実用的になるまで会社を高速化コンピューティングに向け続けたことです。

AlexNet が商業的な重心を変えた

2012年の AlexNet の結果は、NVIDIA が現代の AI を「引き起こした」というストーリーにしばしば圧縮されます。実際の結果は、より具体的でより情報価値があります。Alex Krizhevsky、Ilya Sutskever、Geoffrey Hinton は、ImageNet で深層畳み込みニューラルネットワークを訓練しました。彼らの論文は、トレーニングに3GB のメモリを搭載した2つの NVIDIA GTX 580 GPU で5〜6日かかったと述べています。リンクされた実装は cuda-convnet と呼ばれていました。2012年のコンペティションでは、彼らのアプローチに基づくアンサンブルが15.3%のトップ5テストエラー率を達成し、2位のエントリーの26.2%と比較されました。

これらの数値は結果を確立しますが、単一の原因ではありません。研究者はネットワーク、トレーニング方法、マルチ GPU スキームを設計しました。ImageNet は大規模なラベル付きデータセットを提供しました。ニューラルネットワーク手法の進歩が重要でした。GPU は計算量を数日以内に実行可能にし、CUDA はそれらをプログラムする方法を提供しました。これらの要素のいずれかを取り除けば、歴史は変わります。NVIDIA にすべての功績を認めることは研究を消し去ることになり、プロセッサを偶然として扱うことは論文自身のメモリとトレーニング時間の説明を無視することになります。

Huang にとって、AlexNet は以前の散在するアプリケーションよりも強いシグナルでした。なぜなら、それは拡大する計算需要を持つ一般的な方法を指し示していたからです。ニューラルネットワークはモデルとデータセットが成長するにつれて改善できる一方、トレーニングは大量の並列線形代数を露呈しました。ワークロードの欲求は GPU のアーキテクチャと NVIDIA の長年にわたるソフトウェア投資と一致していました。CUDA は、ブレークスルーが現れた後に開発環境を構築し始める必要がなかったことを意味しました。環境はすでに存在していました。

忍耐が戦略的オプション価値になったのはここです。2012年以前、CUDA は市場が意味があるが断片的だった科学技術分野をサポートしていました。AlexNet 以降、同じ基盤が急速に成長する機械学習コミュニティにサービスを提供できました。1つの化学パッケージや1つの画像アルゴリズムのためにのみ構築されたプラットフォームは、それほど容易に移行できなかったでしょう。CUDA の一般的な抽象化とライブラリは、NVIDIA に1つのアプリケーションの波から別の波への道を提供しました。

NVIDIA の企業年表は、AlexNet を GPU で実現された2012年のマイルストーンとして特定しています。その説明はプロモーショナルであり、元の論文と並行して読まれるべきです。論文は検証可能なハードウェア、トレーニング、エラー率の詳細を提供します。年表は NVIDIA がイベントをどのように解釈したかを示しています。同社は AlexNet を2枚のゲーミングカードの幸運な販売としてではなく、アクセラレーテッドコンピューティングが主要なソフトウェア移行のエンジンになり得るという確証として見ました。

商業的な対応は元の CUDA 言語を超えて拡大しました。NVIDIA はニューラルネットワーク操作のためのライブラリを開発・買収し、トレーニング用のシステムを構築し、専門のハードウェア機能を追加し、研究者がより高いレベルで作業できるフレームワークをサポートしました。元の決定の価値は、すべての AI 開発者が生の CUDA カーネルを書くことではありませんでした。フレームワークの作者やライブラリチームが CUDA をターゲットにでき、何百万ものユーザーが抽象化の層を通じて恩恵を受けられるようにしたことです。

フレームワーク統合がプラットフォームを普通のものにした

多くのユーザーがその最下層と相互作用することなく依存するとき、テクノロジーはインフラストラクチャになります。現代の機械学習開発者は、CUDA C++ではなく Python でテンソル演算を書くことがよくあります。しかし、フレームワークはそれらの演算を CUDA ライブラリとカーネルにディスパッチするかもしれません。ユーザーはテンソルとデバイス名を見ます。プラットフォームは、コンパイル、メモリ割り当て、スケジューリング、最適化されたプリミティブをその下で処理します。

PyTorch はこの関係を明示的にしています。そのCUDA セマンティクスドキュメントは、CUDA テンソルがデバイスにどのように割り当てられるか、ストリームがどのように作業を順序付けるか、複数の GPU がどのように通信するか、デバイスに依存しないコードが CPU と CUDA 実行の間でどのように選択できるかを説明しています。フレームワークは研究者が書かなければならないプラットフォーム固有のコードの量を減らしますが、プラットフォームを消し去るわけではありません。パフォーマンス、メモリ、同期が重要になるとき、CUDA の概念は可視のままです。

TensorFlow は別の独立したシグナルを提供します。そのインストールガイドは、CUDA サポートを含む GPU パッケージパスを提供し、サポートされる GPU 構成に必要なソフトウェアとして NVIDIA ドライバ、CUDA Toolkit、cuDNN をリストしています。繰り返しますが、ほとんどのユーザーは畳み込みカーネルを実装しません。フレームワークとライブラリのメンテナーがその作業を吸収し、彼らのサポートは NVIDIA ハードウェアをより広い人口にアクセス可能にします。

このレイヤリングは2つの方法で CUDA を強化します。第一に、専門家メンテナーの小さなグループが、非常に多くのアプリケーションで使用される演算を最適化できます。より高速な行列乗算やアテンションカーネルは、各チームがそれを書き換えることなく多くのモデルを改善できます。第二に、フレームワークはハードウェアプラットフォームの配布チャネルになります。1つの CUDA GPU でフレームワークを学んだ学生は、同様のコードをワークステーション、クラウドインスタンス、クラスターに持っていくことができます。

同じレイヤリングは、アプリケーションレベルでの直接的な依存を弱める可能性があります。高レベルのフレームワークに対して書かれたコードは、CPU、AMD GPU、Apple プロセッサ、Google アクセラレータ、別のバックエンドでも実行できるかもしれません。デバイスに依存しない API は競争の余地を生み出します。しかし、構文の移植性はパフォーマンスの移植性と同じではありません。カスタム CUDA 拡張、メモリに関する仮定、サポートされていない操作、プラットフォームにチューニングされたカーネルは、移行を依然として高コストにする可能性があります。

その緊張は Huang のプラットフォーム結果の中心です。NVIDIA は、高レベルのツールが CUDA を採用しやすくするときに利益を得ます。同じツールが基礎となるハードウェアを交換可能にするとき、リスクに直面します。同社の回答は、抽象フレームワークがそのスタック上で特にうまく動作するように、最適化されたライブラリ、システム機能、開発者サービスを追加し続けることです。したがって、競争の闘いは、チップの仕様書と同じくらい Python インターフェースの下で発生します。

互換性が過去のコードを次世代 GPU 購入の理由に変えた

開発者エコシステムは、昨日の作業が価値を保持する場合にのみ蓄積されます。すべての新しいプロセッサがアプリケーションを第一原理から再構築することを強制した場合、ライブラリとスキルは急速に減価するでしょう。したがって、NVIDIA の互換性設計は技術的な特徴であると同時に経済的な特徴でもあります。

現在のCUDA プラットフォームドキュメントは、高レベルのコードが PTX(ドライバが物理 GPU 用に変換できる中間表現)にコンパイルできることを説明しています。実行可能ファイルは、複数のアーキテクチャ用のバイナリと将来のアーキテクチャ用の PTX を運ぶことができます。ドキュメントは、PTX をその後のコンピュート能力のためにランタイムでコンパイルできる一方、バイナリ互換性は定義されたアーキテクチャ境界内で適用されると述べています。約束には限界がありますが、開発者に世代を超えたサポートパスを提供します。

互換性は購買行動を変えます。動作する CUDA アプリケーション、訓練されたスタッフ、展開ツールを持つ組織は、新しい NVIDIA GPU を新しいソフトウェアプロジェクトではなく継続として検討できます。新しいハードウェアは最高のパフォーマンスを達成するために依然としてチューニングが必要かもしれませんが、既存の作業を実行できる見込みは採用リスクを低減します。各ハードウェア世代は、以前のソフトウェア投資によって生み出された需要を引き継ぐことができます。

それはまた、NVIDIA の義務を変えます。プラットフォームベンダーは、新しいベンチマークのためにのみ最適化し、古いアプリケーションを結果なしに放棄することはできません。ドライバは約束された境界内で古いコードをロードしなければなりません。ライブラリは非推奨を管理しなければなりません。ドキュメントは、ツールキット、ドライバ、GPU のどの組み合わせがサポートされているかを説明しなければなりません。互換性レイヤーのバグは、会社が書いたことのないアプリケーションに影響を与える可能性があります。エコシステムは、メンテナンスの負担でもあるからこそ資産なのです。

これは、CUDA が単一の高速チップよりも防御可能になった理由を説明するのに役立ちます。ハードウェアのパフォーマンスは競合他社に超えられるか、専用アクセラレータに取って代わられる可能性があります。互換性のあるアプリケーション、ライブラリ、運用知識の集合体はよりゆっくりと移動します。競合他社は、ハードウェア購入だけでなく、移行、検証、再トレーニングを正当化するのに十分な利益を提供しなければなりません。

この優位性は永続的ではありません。互換性自体が面倒になる可能性があり、抽象化レイヤーはプラットフォームの違いを減らす可能性があります。クラウドサービスにより、顧客は新しいクラスターを購入することなく代替案をレンタルできます。オープンスタンダードはコードをポータブルにできます。しかし、CUDA の長期にわたる連続性は、比較が2つの空白のシステム間で行われることはめったにないことを意味します。一方の側にはしばしば何年もの蓄積された作業が存在します。

NVIDIA の財務結果は規模を示すが、CUDA の収益ラインではない

最も目に見える商業的結果は、グラフィックスに焦点を当てたチップサプライヤーからデータセンターコンピューティングシステムとソフトウェアのサプライヤーへの NVIDIA の変革です。2026会計年度の提出書類は、収益が2159億3800万ドルで、2025会計年度から65%増加したと報告しています。Compute and Networking は1934億7900万ドルを貢献し、Graphics は224億5900万ドルでした。データセンター収益は前年比68%増加し、同社はこれをアクセラレーテッドコンピューティングと AI プラットフォームシフトによるものとしています。

これらの数字は並外れていますが、CUDA を個別に測定しているわけではありません。NVIDIA は GPU、ネットワーキング、システム、サービス、一部のソフトウェアを販売しています。顧客需要はまた、モデルの成長、クラウドの設備投資、メモリ供給、製造能力、ネットワーキングパフォーマンス、最近のアーキテクチャの機能を反映しています。CUDA はシステムを有用にするのに役立ちますが、提出書類は部外者がそれなしでどれだけのドルが消えるかを計算することを許していません。

正しい主張はより狭いものです。NVIDIA の表明された戦略とその最大の収益セグメントは現在、CUDA を基盤とする完全なコンピューティングプラットフォームに依存しています。10-K は、同社がハードウェア、システム、ソフトウェア、アルゴリズム、ライブラリ、モデル、データセット、サービスを組み合わせていると述べています。また、大規模で成長している開発者ベースとインストールベースがプラットフォームの価値を高めると述べています。経営陣は明示的にネットワーク効果をビジネスモデルの一部として説明しています。

投資は別の測定可能な結果を提供します。NVIDIA は2026会計年度に184億9700万ドルの研究開発費を報告し、前年から43%増加しました。42,000人の従業員のうち約31,000人が年末に研究開発に従事しており、設立以来の累積投資は767億ドルを超えていると述べています。これらの合計は会社全体をカバーしており、CUDA だけではありません。これらは現在、共有アーキテクチャとその多くのソフトウェアスタックを支えている組織規模を示しています。

規模はまた集中と実行リスクをもたらします。提出書類は、1つの直接顧客が2026会計年度の収益の22%を占め、別の顧客が14%を占めたと述べており、主に Compute and Networking です。プラットフォームはユースケースを多様化できますが、売上はシステムビルダーとクラウドプロバイダーに集中したままです。CUDA の広範な開発者リーチは、NVIDIA が何百万もの開発者に直接請求するか、購買力が均等に分配されていることを意味しません。

したがって、財務結果は単純な因果関係の方程式を証明することなく、プラットフォームのストーリーをサポートします。Huang の決断は、NVIDIA にプロセッサができることを拡大する耐久性のある方法を提供しました。AI 需要、エンジニアリングの実行、供給パートナーシップ、外部のイノベーションがそのオプションを収益に変換しました。厳密な評価は CUDA を基盤として認める一方で、すべてのドルを「CUDA 収益」とラベル付けすることを拒否できます。

堀は有用なソフトウェアであり、それを離れるコストでもある

人々は CUDA を堀(モート)と表現することがよくあります。この比喩は、水の中に何があるかを説明しない限り不完全です。障壁は、CUDA が NVIDIA が管理するプログラミング環境であるというだけではありません。それは、チューニングされたライブラリ、動作するアプリケーション、ドキュメント、スタッフの専門知識、デバッグプラクティス、互換性、利用可能なハードウェアの組み合わせ価値です。顧客は、その組み合わせが代替案よりも多くの時間を節約したり、より良い結果を生み出したりするときに留まります。名前だけが移動を防ぐからではありません。

OECD の2025年 AI インフラ競争に関するペーパーは、ソフトウェアを GPU 効果的にするために重要であると説明し、NVIDIA が AI に使用される GPU の80%以上の市場を保持しているという推定を引用しています。これは、パフォーマンス、先発者の優位性、CUDA に同社のポジションを結び付けています。パーセンテージは OECD が使用する二次市場推定であり、公式の出荷センサスではないため、正確な普遍的なシェアではなく集中の指標として扱われるべきです。

その後のOECD 競争円卓会議の要約は、NVIDIA GPU と CUDA の間の間接的なネットワーク効果を説明しています。より多くのソフトウェアがハードウェアを魅力的にし、より広範なハードウェア採用がより多くのソフトウェアを奨励します。また、開発環境への依存がスイッチングを技術的に困難かつ高コストにし、時にはソフトウェアの再設計と時間を必要とするという懸念を記録しています。同時に、議論は、他のチップメーカー、クラウドプロバイダー、AI 開発者が代替案を追求しているため、市場は潜在的に争奪可能であると特徴付けています。

このバランスの取れた説明は、すべての依存関係を虐待的と呼んだり、すべての優位性を当然と呼んだりするよりも有用です。CUDA は効率を生み出します。開発者は最適化されたコードを再利用でき、組織は関連スキルを持つ人材を雇え、フレームワークメンテナーは安定したプラットフォームをターゲットにできます。これらの利点がエコシステムに力がある理由です。同じ再利用が、買い手が異なるアクセラレータを望むときにはスイッチングコストになり得ます。

コストはワークロードによって異なります。複数のバックエンドで利用可能な高レベルフレームワーク操作のみを使用するアプリケーションは、限られたコード変更で移行できるかもしれませんが、パフォーマンスと展開のテストは依然として必要です。長年のカスタム CUDA カーネルと NVIDIA 固有のライブラリを含む科学コードは、大規模なエンジニアリングを必要とするかもしれません。CUDA クラスターを自動化してきた企業は、新しい監視、スケジューリング、デバッグプラクティスも必要になるかもしれません。「ロックイン」は二値状態ではなく、移行コストの積み重ねです。

したがって、Huang の決定は2つの視点から同時に評価できます。NVIDIA の視点からは、蓄積された開発者投資により、各世代はより価値が高く、競合他社のチップ発売に対して脆弱ではなくなります。顧客の視点からは、エコシステムは今日の構築コストを下げる一方で、明日のサプライヤー変更コストを上げる可能性があります。どちらも同じプラットフォーム成功の結果です。

競合他社はシリコンだけでなくプログラミングコストを攻撃する

移植性ツールの存在は、競合他社が優位性がどこにあるかを理解していることを示しています。AMD のHIP ドキュメントは、1つのソースが AMD GPU と NVIDIA GPU をターゲットにできるように設計された C++ランタイムおよびカーネル言語を説明しています。その移植資料は、開発者がどのように CUDA コードを段階的に変換し、関数とパフォーマンスをオリジナルと比較できるかを説明しています。移行パスの存在そのものが2つのことを確認します。CUDA コードには保存する価値があり、それを移動することはツール化する価値のある問題であるということです。

Khronos は標準ベースのルートを取ります。SYCLは、CPU、GPU、FPGA を含むヘテロジニアスプロセッサ向けのオープン、ロイヤルティフリー、クロスプラットフォームの C++抽象化です。そのドキュメントは境界について注意深く説明しています。共通言語と API はコードをポータブルにすることができますが、自動的で完璧なパフォーマンス移植性を保証するものではありません。開発者は依然としてアーキテクチャ固有のバリアントとチューニングを必要とするかもしれません。

これらの代替案は、CUDA が永遠に支配しなければならないという決定論的なストーリーを防ぎます。高レベルフレームワークはますます複数のデバイスをサポートしています。クラウドプラットフォームは競合するアクセラレータを露出できます。大規模なバイヤーは特定のワークロード向けにカスタムチップを構築できます。オープンプログラミング標準は、1つのサプライヤーに結びつけられたコードの量を減らすことができます。推論ワークロードは、巨大なトレーニングシステムとは異なるコストとエネルギーのトレードオフに報いる可能性があります。

しかし、移植性レイヤーは構文だけでなく成熟度と競合しなければなりません。翻訳されたカーネルは正しくなければなりません。ライブラリは必要な操作をカバーしなければなりません。パフォーマンスツールはボトルネックを特定しなければなりません。展開は安定していなければなりません。ドキュメントとコミュニティの知識はエッジケースに答えなければなりません。アプリケーションは、ソースプラットフォームとターゲットプラットフォームの両方が変化しても動作し続けなければなりません。これが、競合他社のプロセッサが有能であっても、ソフトウェアエコシステムが迅速にコピーすることが難しい理由です。

競争はまた CUDA を改善することができます。顧客が移動できる場合、NVIDIA はパフォーマンス、信頼性、開発者生産性を通じて採用を獲得し続けなければなりません。代替案がライブラリのギャップを埋める場合、同社は歴史的なコードだけに頼ることはできません。プラットフォームは新しいモデル、数値フォーマット、メモリシステム、マルチ GPU パターンを吸収し続けなければなりません。進化を止めた堀は島になります。

政策の問題は、独自プラットフォームが成功する可能性があるかどうかではありません。それは、その成功をめぐる行動が不公正に代替案を妨害したり、相互運用性を制限したり、隣接市場を有害な方法で結びつけたりするかどうかです。OECD 資料はこれらを継続的な監視の事項として特定しており、CUDA 自体が違法であるという調査結果ではありません。観察可能な事実は、ソフトウェアとハードウェアが市場構造を形成するのに十分に強く互いを強化しているということです。

地政学はかつて規模が統一したエコシステムを分割し得る

CUDA の初期の提案は広範な可用性でした。開発者は1つのモデルを学び、コンシューマーカード、ワークステーション、サーバーにわたって NVIDIA ハードウェアで実行できました。輸出規制と地域の技術政策はその提案を複雑にします。NVIDIA の2026会計年度提出書類は、制限が年末時点で中国のデータセンターコンピューティング市場から事実上締め出し、排除が競合他社がより大きな開発者と顧客エコシステムを構築するのに役立つ可能性があると警告しています。

その警告は、NVIDIA が市場アクセスをどのように評価しているかを明らかにします。失われた販売は失われたユニットだけではありません。それは、別のツールチェーンを学ぶ開発者、異なるプラットフォームを教える大学、代替案を最適化するクラウド、CUDA をデフォルトとして扱わなくなるアプリケーションになる可能性があります。エコシステムの競争は両方向に複合します。

これは、特定の輸出政策が正しいか間違っているかを証明するものではありません。国家安全保障の決定は、企業収益やソフトウェア採用を超えた考慮事項を衡量します。しかし、それは Huang のプラットフォーム戦略に対する制約を示しています。ハードウェアが開発者に届く管轄区域、サプライチェーン、ルールを管理する民間企業は存在しません。基礎となるデバイスへのアクセスが断片化するとき、グローバルに統一されたプログラミング基盤も断片化する可能性があります。

供給も別の制約です。CUDA は、プロセッサ、メモリ、パッケージング、電力、ネットワーキング、データセンター容量なしでは高速化を提供できません。NVIDIA は主要チップを設計しますが、製造パートナーに依存しています。最近のプラットフォームは、GPU カードから、部品が連携して動作しなければならない完全なシステムへと拡大しています。ソフトウェアは希少なハードウェアの有用性を高めますが、それをさらに製造することはできません。

顧客の集中はさらなる依存を生み出します。大規模なクラウドプロバイダーは CUDA 容量を多くのユーザーに分配しますが、独自のアクセラレータを開発し、代替フレームワークを推進することもできます。NVIDIA のプラットフォームはクラウドがコンピューティングサービスを販売するのを助け、クラウドは NVIDIA 製品へのアクセスを仲介します。エコシステムは一方通行のロックではありません。主要顧客は価格設定、展開、競合するアーキテクチャの選択を形成できます。

これらの制約は、リーダーシップのストーリーを地に足のついたものに保ちます。Huang の決断はレバレッジを生み出しましたが、無敵ではありません。同社はソフトウェアを維持し、ハードウェアを出荷し、規制をナビゲートし、新しい世代の開発者を説得しなければなりません。プラットフォームの過去の採用は時間と流通を買いますが、実行リスクをキャンセルするわけではありません。

功績はリーダーシップ、エンジニア、ユーザーに異なる割合で帰属する

2026年の IEEE 栄誉賞は有用な外部の定式化を提供します。IEEE Spectrumは、Huang が GPU の開発とその科学計算と AI への応用におけるリーダーシップを認められたと述べています。「リーダーシップ」という言葉は正確です。それは、彼が個人的にあらゆるコンポーネントを作成したと主張することなく、技術的ビジョンと組織的方向性を認めています。

CUDA ストーリーにおける Huang の最も強く文書化された行動は、パターン認識、コミットメント、プラットフォームフレーミングです。彼は非グラフィックス利用を共通のコンピューティングニーズの証拠として見ました。彼は統一されたプログラム可能アーキテクチャを支持しました。彼は会社が科学計算と AI を進む間、ソフトウェアと開発者採用を中心に保ちました。彼はまた、NVIDIA をコンポーネントサプライヤーではなくプラットフォームとして公に説明しており、その説明は現在その規制提出書類と一致しています。

エンジニアの貢献はシステムそのものです。Buck と Brook チームは重要な研究の系譜を提供しました。Nickolls、Buck、Garland、Skadron と多くの同僚が初期モデルを定義し説明しました。コンパイラ、ドライバ、ライブラリ、アーキテクチャ、開発者関係チームがローンチを維持された環境に変えました。フレームワークの作者、研究者、アプリケーション開発者は CUDA を NVIDIA だけでは構築できなかった分野に拡張しました。

ユーザーは決定的なテストを提供しました。医用画像と化学が初期のシグナルを提供しました。科学者は規模と数値的要求を露呈しました。AlexNet チームは産業の優先順位を変えた機械学習の結果を実証しました。PyTorch と TensorFlow のメンテナーは、広く使用されるフレームワークを通じて GPU 実行を利用可能にしました。そして顧客は、システム全体がそのコストを正当化するかどうかを決定しました。

これらの役割を分離することは、Huang の記録を向上させ、減少させるものではありません。経営幹部のリーダーシップは、エンジニアリングを模倣するから価値があるのではありません。エンジニアリングと外部のイノベーションが複合する方向性を選択するときに価値があります。検証可能な結果は、コンピューティングの複数の波にわたって1つのプログラミングアーキテクチャを関連性のあるものに保った組織です。

それはまた説明責任をより明確にします。Huang は戦略的コミットメントについて功績を認められ、プラットフォームの行動、投資優先順位、市場の主張について責任を問われることができます。技術チームは実装について功績を認められます。研究者は彼らの発見の作者としての地位を保持します。顧客はプラットフォームの利益がそのコストを上回るかどうかを判断できます。英雄ストーリーはそれらの線をぼやかします。プラットフォームストーリーはそれらを必要とします。

長期的賭けの実用的なスコアカード

2006年の発表から20年後、CUDA の決定はいくつかの観察可能な結果に対してテストできます。

第一に、プログラミングモデルは発売ハードウェアよりも長生きしましたか?はい。現在の CUDA ドキュメントは、カーネル、スレッド階層、ヘテロジニアス実行の中核概念を保存しながら、現代のマルチ GPU システムに対応しています。互換性メカニズムは、表明された制限内で、アプリケーションに複数世代にわたるパスを提供します。

第二に、開発者はグラフィックス以外で使用しましたか?はい。初期の技術文献は、化学、画像処理、線形代数、物理学を文書化しています。Titan は GPU アクセラレーションを大規模な国立研究所システムの一部にしました。AlexNet は2つの NVIDIA GPU と CUDA 実装を使用して、画期的な画像分類結果を達成しました。現在の PyTorch と TensorFlow のドキュメントは、CUDA をサポートされる実行ルートとして公開しています。

第三に、補完エコシステムは形成されましたか?NVIDIA は、現在400万人以上の開発者が高速化アプリケーションを構築していると述べ、財務提出書類で数百のライブラリ、フレームワーク、アルゴリズム、開発インターフェースを説明しています。企業カウントの背後にある正確な活動は公開されていませんが、独立したフレームワークのドキュメントは、CUDA が広く使用されるソフトウェア層に組み込まれていることを確認しています。

第四に、プラットフォームはより大きなビジネスを支えましたか?NVIDIA の Compute and Networking の収益は2026会計年度で1934億7900万ドルに達し、Graphics セグメントをはるかに上回りました。同社はアクセラレーテッドコンピューティングと AI をデータセンター成長のドライバーとして特定し、CUDA をそのスタックの基盤に位置付けています。CUDA の因果的シェアを隔離する開示はないため、結果は宣言された戦略内の関連性であり、独立したソフトウェア収益の計算ではありません。

第五に、戦略は防御可能性を生み出しましたか?OECD は、高度に集中した AI GPU 市場を説明し、CUDA をネットワーク効果とスイッチングコストに結び付けています。AMD HIP と SYCL は、それらのコストを削減するために部分的に存在しています。移植性への継続的な投資自体が、インストールされたソフトウェアベースが競争上重要であることの証拠です。

第六に、未解決のコストはありますか?はい。移行は高コストになる可能性があり、プラットフォームの集中は買い手の選択肢を減らす可能性があり、互換性は継続的なメンテナンスを必要とし、グローバルアクセスは規制と供給制約によって混乱する可能性があります。代替ハードウェアとプログラミングモデルは、市場を争奪可能に保ちます。成功したプラットフォーム決定は、リターンと同様に義務も生み出します。

このスコアカードは2つのエラーを避けています。1つは後知恵の確実性です。CUDA の後の成功は、その初期市場が保証されていたことを意味しません。もう1つは創業者神話です。戦略的一貫性は、Huang を多くの人々によって生み出された技術的作業の唯一の創造者にはしません。永続的な成果は、リーダーシップ、アーキテクチャ、ソフトウェア、外部採用の連携です。

永続的な決定は他人の発明を助成することだった

CUDA の最も深い戦略的効果は、NVIDIA ハードウェアを他の人々が価値を生み出せる場所にしたことです。科学者はシミュレーションを高速化でき、フレームワークチームはテンソル演算を最適化でき、スタートアップはモデルを展開でき、クラウドは結果として得られるシステムへのアクセスを販売できました。NVIDIA はすべてのアプリケーションを発明する必要はありませんでした。次のアプリケーションがそのプラットフォームを選択する可能性を高める必要がありました。

それは半導体会社の性質を変えます。製品はチップが検証を通過したときに完了しなくなりました。コンパイラ、ライブラリ、アプリケーションがシリコンを有用にするまで未完成のままであり、次のソフトウェアの波が他の場所で形成される場合、リスクにさらされたままです。開発者関係、互換性、教育は戦略的機能になります。時間軸は1つのハードウェアサイクルを超えて延びます。

Huang の長期的賭けが成功したのは、真のアーキテクチャ上の優位性をそのより長い時間軸と結びつけたからです。GPU はグラフィックス用に作られた並列スループットを持っていました。研究者は他の問題もそれを使用できることを示していました。CUDA はプログラミング障壁を低くしました。ライブラリとフレームワークはアクセスを広げました。互換性は蓄積された作業を保存しました。各層が次の層をより価値あるものにしました。

同じ構造が依存に関する現在の議論を説明しています。プラットフォームが開発者の何年もの作業を節約するとき、それを離れることは何年もの作業を要するかもしれません。顧客はエコシステムから利益を得て、その所有者にさらされます。競合他社はベンチマークだけでなく、エクスペリエンスに一致しなければなりません。規制当局は同じ事実のセットの中に潜在的な効率性と潜在的な障壁を見ます。

最も公正な結論は、CUDA だけが AI を生み出したのでもなく、NVIDIA がたまたま適切なチップを販売したのでもないということです。Huang は不確実な需要に直面して、初期の持続的なプラットフォーム決定を行いました。NVIDIA のエンジニアと学術的先駆者はプログラミングモデルとその機械を構築しました。研究者と開発者はそれが何ができるかを証明しました。結果として得られたエコシステムは、GPU をグラフィックスコンポーネントから汎用コンピューティングプラットフォームに変えるのに役立ち、NVIDIA にその最も強力な戦略的資産と最大の責任の両方を与えました。