# NVIDIA GPU・AI アクセラレータ・AI インフラの最大手企業。H100/H200 等の GPU、[[NCCL]] 等の集団通信ライブラリ、[[Megatron-LM]] 等の訓練フレームワーク、[[TensorRT-LLM]]/[[NVIDIA NIM]] 等の推論スタック、[[NIXL]] 等のデータ転送ライブラリ、[[BlueField-3]] 等の SmartNIC/DPU を開発し、LLM の訓練から推論までのフルスタックを支える。[[GenAI-Perf]] で推論ベンチマーク標準化にも取り組む。 Hopper 世代では [[NVIDIA H100]]、FP8 対応の第4世代 Tensor Core、[[Transformer Engine]]、[[Tensor Memory Accelerator]]、第4世代 [[NVLink]]、第3世代 NVSwitch、[[NVIDIA SHARP]] を組み合わせ、GPU 単体から最大256 GPU規模のスケールアップ構成までを製品化した([[@2022__NVIDIA Developer Blog__NVIDIA Hopper Architecture In-Depth]])。 Blackwell 世代では GB203/[[RTX 5080]] を対象に、統合 INT32/FP32 実行ユニット、第5世代 Tensor Core、FP4/FP6 対応を展開した。Hopper の GH100 と比較したマイクロベンチマークでは、低精度 MMA の一部で Blackwell が優位な一方、H100 は FP64、HBM2e の global memory 帯域、大規模 FP8 D-GEMMで有利な条件を示した。(Source: [[@2025__arXiv__Dissecting the NVIDIA Blackwell Architecture with Microbenchmarks]]) Scaling Up RL 論文では、1.5B パラメータモデルに対する長期 RL 訓練の体系的調査を行い、[[Nemotron-Research-Reasoning-Qwen-1.5B]] を公開した。 [[Nemotron 3]] ホワイトペーパーでは、ハイブリッド Mamba–Transformer MoE アーキテクチャと [[LatentMoE]]・NVFP4 事前学習・マルチ環境同時 RL を組み合わせた Nano/Super/Ultra の 3 モデルファミリーを発表した。ポストトレーニングソフトウェアスタック [[NeMo-RL]]・NeMo-Gym を Apache 2.0 で公開する。 From Detection to Recovery 論文では、NVIDIA Korea が SKT、Upstage、[[Lablup Inc]]、[[VAST Data]] と統一監視パイプラインを共有する 5 者の一つとして登場する。対象クラスタは 63 ノードの NVIDIA HGX B200、合計 504 GPU で、XID 79/94/119/145/149 などの GPU ドライバエラーを障害検知・復旧判断の一次情報として使う。 [[@2026__ICLR2026__TimeOmni-1 - Incentivizing Complex Reasoning with Time Series in Large Language Models]](ICLR 2026)に NVIDIA Academic Grant として資金提供し、共著者 [[Chao-Han Huck Yang]] が所属する。時系列推論モデルの後訓練(GRPO)研究を支援する位置にある。 [[Oak Ridge National Laboratory]] との共同研究([[@2022__NSDI__Accelerating Collective Communication in Data Parallel Training across Deep Learning Frameworks]]、NSDI 2022)では、[[Joshua Romero]] と Sean Treichler が [[Horovod]] の集団通信改善(応答キャッシュ・グルーピング)を主導し、27,600 GPU([[Summit]] 全体)でスケーリング効率 0.93 と 1.54 エクサフロップス(FP16 持続)を実証した。 CUDA ランタイム(`libcudart.so`)は、eBPF uprobe を使った非侵襲な CUDA API トレースの対象としても扱われる。GPU 利用の入口をソース改変なしで可視化する一例として、[[@2026__eunomia.dev__CUDA Events - eBPF-based CUDA API Tracing]] が挙げられる。(Source: [[@2026__eunomia.dev__CUDA Events - eBPF-based CUDA API Tracing]]) NVIDIA の proprietary driver は DRM の共通スケジューラトレースポイントとは異なる独自の `nvidia.ko` インターフェースを使うため、GPU ドライバ観測では `nvidia_open`・`nvidia_unlocked_ioctl`・`nvidia_mmap`・`nvidia_isr` などへの kprobe と `nvidia:nvidia_dev_xid` を組み合わせる。(Source: [[@2025__eunomia.dev__eBPF Tutorial by Example - Monitoring GPU Driver Activity with Kernel Tracepoints]]) GPU 観測性では、NVIDIA Data Center GPU Manager(DCGM)が GPU 利用率、メモリ、電力、クロックなどの性能メトリクス収集を担う。[[Zoomer]] は DCGM を [[Kineto]] の実行トレースや [[Dynolog]] のホストテレメトリと組み合わせ、NVIDIA GPU だけでなく AMD MI300X、MTIA、CPU を含む異種ワークロードへ分析・最適化を広げる方向を示している。(Source: [[@2025__EngineeringAtMeta__Zoomer - Powering AI Performance at Meta's Scale Through Intelligent Debugging and Optimization]]) [[Triton Inference Server]]は[[Netflix]]のMSS(Model Scoring Service)でGPU推論の共有バックエンドとして本番運用されており、モデルパッケージング方式(Pythonバックエンド vs vLLMバックエンド)の選択やバージョン整合が本番運用上の主要な論点になっている。(Source: [[@2026__Netflix TechBlog__In-House LLM Serving at Netflix]]) [[MLCommons Chakra]]の共同開発企業の一つ。分散AI/MLワークロードの標準実行トレース形式の策定に主要著者(責任著者 [[Srinivas Sridharan]] を含む10名)を送り込んでおり、PyTorchとNVIDIA NeMoにChakra ETの収集機能を正式統合している。(Source: [[@2026__MLSys2026__MLCommons Chakra - Advancing Performance Benchmarking and Co-design using Standardized Execution Traces]]) [[Fixstars]] による [[Kimi K3]](2.8T MoE)の Day0 デプロイ検証(2026-07-28)では、B300 SXM6 x8(HBM3e 288GB×8、NVLink 5.0 片方向956 GB/s/GPU)の単一ノードが検証環境として用いられ、2.8T パラメータ級モデルが実用速度で動作することを実測で示した。(Source: [[@2026__Fixstars Tech Blog__Kimi-K3 を Day0 デプロイ - 2.8T モデルは NVIDIA B300 x8 の 1 ノードで動くのか]]) [[NVIDIA Rubin GPU]](Blackwell 後継)と、それをラックスケールへ統合する [[NVIDIA Vera Rubin NVL72]] を発表した。エージェント型 AI 推論(長い推論ステップ列・低レイテンシ・高デコードスループット・長コンテキストアテンション・大容量 KV キャッシュ)に特化した設計で、第 3 世代 Transformer Engine(NVFP4 で最大 50 PFLOPS)・HBM4(最大 288GB、22 TB/s)・K 次元テンソルコアスループット倍増・NVLink 6(3,600 GB/s)counted writes・Intelligent Power Smoothing + DSX MaxLPS(同一電力予算で GPU 数最大 40% 増)を組み合わせる。(Source: [[@2026__NVIDIA Developer Blog__Inside NVIDIA Rubin GPU Architecture Powering the Era of Agentic AI]]) [[@2026__arXiv__FlashInfer-Bench - Building the Virtuous Cycle for AI-driven LLM Systems]](MLSys 2026)の共著者 Yong Wu・[[Zihao Ye]]([[FlashInfer]] 著者)・[[Luis Ceze]]([[University of Washington]] と兼務)の所属。同論文は [[FlashInfer]] を性能ベースラインとし、`flashinfer_bench.apply()` による動的カーネル置換で SGLang・vLLM 等の本番エンジンへ AI 生成カーネルを統合する運用フレームワークを提案した。NVIDIA B200・RTX 4090 が評価ハードウェアとして使われている。(Source: [[@2026__arXiv__FlashInfer-Bench - Building the Virtuous Cycle for AI-driven LLM Systems]]) 「Beyond the Buzz」論文(NVIDIA Corporation の19名による著者チーム、[[Tiyasa Mitra]]・[[Bita Darvish Rouhani]]ほか)では、社内の proprietary な high-fidelity GPU 性能シミュレータを用いて、disaggregated inference serving の設計空間を数十万点規模でシミュレートし、モデルアーキテクチャ・サイズ・トラフィックパターン・NVLink ドメインサイズにわたる感度分析を行った。modern Blackwell systems 上での FP4(NVFP4/MXFP4)精度運用を前提としており、[[NVIDIA Dynamo]] が提供する動的資源割当の必要性を実証的に裏付ける。(Source: [[@2026__MLSys2026__Beyond the Buzz - A Pragmatic Exploration of Prefill-Decode Disaggregation in Large Scale Inference]]) [[@2025__arXiv__GPU-Initiated Networking for NCCL]](Khaled Hamidouche・John Bachan・Sylvain Jeaugey ほか9名、全員 NVIDIA Corporation)は、[[NCCL]] 2.28 の Device API のうち GPU-Initiated Networking(GIN)を解説する。GDAKI(DOCA GPUNetIO による直接 GPU-to-NIC 通信)と Proxy(ロックフリー GPU-to-CPU キュー)の二重バックエンドで、GDAKI は16.7µsの往復レイテンシを達成し NVSHMEM IBRC に匹敵する。[[DeepEP]] への統合により MoE 通信ライブラリの実運用検証も行った。(Source: [[@2025__arXiv__GPU-Initiated Networking for NCCL]]) [[wiki/entities/AI Systems Performance Engineering|AI Systems Performance Engineering]] 第3章では、GPUドライバ・CUDA Toolkit・Container Toolkit・[[Kubernetes]] GPU Operator/デバイスプラグインからなるソフトウェアスタック全体がGPU利用率を左右すると解説される。永続化モード([[NVIDIA]] Persistence Daemon)、[[GPU多重化(MPS・MIG)]](MPS・MIG)、[[NUMA対応CPUピニング]]、Data Center GPU Manager(DCGM)によるGPU監視などが主要な運用ノブとして紹介される。(Source: [[@2025__OReilly__AI Systems Performance Engineering - Chapter 3 OS, Docker, and Kubernetes Tuning for GPU-Based Environments]]) 「The Anatomy of Silent Data Corruption」(arXiv 2026、[[Chung-Hsuan Tung]]・[[Yanxiang Huang]]・[[Nirmal Saxena]]・[[Philip Shirvani]]・[[Saurabh Hukerikar]]・[[Twinkle Jain]]・[[Abhishek Tyagi]]・[[Sanjay Gongalore]])では、NVIDIAのproduction-classデータセンターGPUを反映した2-SM構成のゲートレベルモデルに対して300万シミュレータ時間規模のstuck-at故障注入を実施し、Silent Data CorruptionがNaN/±INF(1.01%)よりnullification(50.68%)に支配され、単一ビット反転が非特殊破損の40%未満にとどまり、破損アドレスがwarpサイズ(W=32)を法とした空間周期性を持つことを定量化した。(Source: [[@2026__arXiv__The Anatomy of Silent Data Corruption - GPU Error Pattern Study and Modeling Guidance]]) [[Taekyung Heo]]・[[Bita Darvish Rouhani]]ほか9名(全員NVIDIA)による「[[@2026__arXiv__Cross-Model KV Cache Transfer in LLM Families - A Closed-Form Linear Mapping for Prefill Reuse]]」(arXiv 2026)は、同一LLMファミリ内(Qwen3・Llama 3.1・Ministral 3)の異なるサイズのモデル間でKVキャッシュを転送し、受信側の再プリフィルを省略する閉形式per-headリッジマッパーを提案した。8×H100ノードでの評価で、6matched-KVペア中4ペアが標準精度の73〜98%を保持しつつ再プリフィルより2.7〜25倍高速であることを示した。(Source: [[@2026__arXiv__Cross-Model KV Cache Transfer in LLM Families - A Closed-Form Linear Mapping for Prefill Reuse]]) [[David Goodwin]]は、[[Knative]] ベースのサーバーレス機械学習推論プロジェクト [[KFServing]] を解説する [[@2020__arXiv__Serverless inferencing on Kubernetes]](ICML 2020 ワークショップ論文)の共著者。NVIDIA GTC 2020 で [[Dan Sun]]([[Bloomberg L.P.]])と共同発表した「Accelerate and autoscale deep learning inference on GPUs with KFServing」が同論文で参照されており、KFServing の GPU オートスケーリング(Knative Pod Autoscaler によるリクエストベースオートスケーリング)の本番運用経験を扱う。(Source: [[@2020__arXiv__Serverless inferencing on Kubernetes]]) 『実践SONiC入門』第4章が2023年12月時点でまとめた商用版SONiC提供ベンダー一覧(表4.1)によれば、NVIDIAは商用版SONiCを提供しており、ASICベンダーによる直接的なSAIサポートを特徴とする。BroadcomやCiscoと同様、自らSwitch ASICを持つベンダーとして商用版SONiCを提供する立場にある。(Source: [[@2025__Gihyo__実践SONiC入門 - Chapter 4 商用版SONiCと有償サポート]] ch.4 §4.3、表4.1) TEF 2025(Ethernet Alliance, 2025年12月)のパネル発表(Gilad Shainer)では、NVIDIA は光インターコネクトの電力効率議論において [[Co-Packaged Copper (CPC)|CPO]](Co-Packaged Optics)を主軸に据える立場を示し、電力効率3.5倍・レジリエンシ10倍・アップタイム5倍を主張した。ただしこれは一社の主張であり業界合意ではなく、「CPOとプラガブルの前面パネルフォームファクタの線引き」は2026年8月時点でも標準化団体間の未決論点として扱われている。1.6Tあたりの光インターコネクト方式別の消費電力比較では、FRO(Full-Retimed Optics)14 pJ/bit・25W → TRO(Tx-Retimed Optics)10 pJ/bit・18W → LPO(Linear Pluggable Optics)6.4 pJ/bit・11W → CPO 4 pJ/bit・7W という段階的な削減が示された。(Source: [[@2026__SpeakerDeck__AIのためのEthernet技術動向 (SerDes)]]) `Computer Architecture: A Quantitative Approach`第4章は、GPUアーキテクチャ全体の解説にNVIDIAの[[CUDA]]プログラミングモデルと[[NVIDIA Pascal]](Tesla P100/GP100)を主要な実例として用いる。GPU独自の用語(CUDA Thread、Warp、Streaming Multiprocessor等)をベクトルアーキテクチャの用語・記述的な用語へ段階的に対応づける表(図4.12、4.21、4.24)を核に、NVIDIAコンパイラの抽象命令セット[[PTX]]がハードウェア世代交代(x86的命令セットからRISC-V的命令セットへの変更)を経てもソフトウェアスタックの互換性を保つ役割を担うと説明する。同章はまた、NVIDIA GTX 280・Tesla P100とIntel CPUとのRooflineモデル比較・実測ベンチマーク比較(Lee et al. 2010)を通じて、gather-scatterアドレッシング(ベクトルアーキテクチャ由来)を持つNVIDIA GPUが、当時これを欠いていたIntel SIMD拡張に対し特定カーネル(衝突検出GJK)で最大15.2倍の速度差を生むことを示す。(Source: [[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 4 Data-Level Parallelism in Vector, SIMD, and GPU Architectures]] §4.4, §4.7) [[AI Chip Architectures]]は、V100からRubinに至るTensor Coreの6世代(mma.sync→wgmma.mma_async→tcgen05.mma)を、行列積和命令の発行に必要なスレッド数が32(warp)→128(warp-group)→1(単一スレッド)へ縮小し、issueと実行が段階的に非同期化してきた過程として整理する。Blackwellの`tcgen05.mma`ではオペランドA/Bがシェアードメモリ記述子(またはTMEM直読)に、アキュムレータDが専用のTensor Memory(TMEM、256KB/SM)に着地するため、発行スレッドは即座に他の作業へ戻れる。この非同期化がFlashAttention系カーネル(softmax・マスキング・次タイルのプリロードをmatmulの裏で回す)を成立させる直接の技術的前提であるとされる。メモリ階層も並行して非同期化しており、Ampereの`cp.async`(HBM→SMEM直接コピー)からHopperのTMA(記述子1つでマルチ次元タイルのDMAをwarp全体から切り離す、クラスタレベルmulticast対応)、Blackwellの TMEM直接ロードへと、warpが1タイルあたりに行う仕事を世代ごとに減らしてきた。スケールアップはNVLink+NVSwitch(NVL72で72GPU・130 TB/s all-to-all、受動銅配線で~20kW/rackの電力節約)、スケールアウトはMellanox由来のInfiniBand/Spectrum-X。ソフトウェアの堀はCUDA自体よりも18年分のサードパーティ製カーネル・ライブラリ(cuBLAS/cuDNN/CUTLASS/TensorRT-LLM)と、フロンティア研究所へのエンジニア常駐という人的資本にあると評される。2025年に[[Groq]]のLPU技術を非独占ライセンス取得し創業者Jonathan Rossと開発チームの大半を採用、2026年GTCで「NVIDIA Groq 3 LPU」としてRubin NVL72の横にAttention-FFN分離のレイテンシ補助プロセッサとして統合した。(Source: [[AI Chip Architectures]]) ## 関連 - ソース: [[@2026__POMACS__Minos - Systematically Classifying Performance and Power Characteristics of GPU Workloads on HPC Clusters]] ## 出典 - [[@2026__arXiv__The Multipath Reliable Connection (MRC) Transport]](MRC トランスポート仕様の共著組織の一つ) - [[@2013__ICPP__Efficient Inter-node MPI Communication using GPUDirect RDMA for InfiniBand Clusters with NVIDIA GPUs]](NVIDIA GPUDirect RDMA(GDR)をMellanoxと共同でInfiniBand向けに提供した最初期の評価論文) - [[@2026__NVIDIA__GPUDirect RDMA]](GPUDirect RDMA公式ドキュメントの発行元) - [[@2014__NVIDIA Developer Blog__Benchmarking GPUDirect RDMA on Modern Server Platforms]](GPUDirect RDMAのサーバープラットフォームベンチマーク記事の発行元)