# NVIDIA Rubin GPU [[NVIDIA]] が [[NVIDIA Blackwell|Blackwell]] の後継として設計した GPU。エージェント型 AI(agentic AI)推論——複数ステップにわたる推論・計画・ツール利用・長コンテキストアテンションを継続する実行パターン——に特化したアーキテクチャで、内部 2T MoE ワークロード計測において Blackwell 比でエージェント推論スループット/電力を最大 10 倍に向上させるよう設計されている。(Source: [[@2026__NVIDIA Developer Blog__Inside NVIDIA Rubin GPU Architecture Powering the Era of Agentic AI]]) ## アーキテクチャ概要 レチクル限界のダイ 2 枚を NV-HBI(NVIDIA High-Bandwidth Interface)で単一パッケージに統合する構成。336B トランジスタ・224 SM(Streaming Multiprocessor)・896 [[テンソルコア|テンソルコア]] を搭載し、第 3 世代 Transformer Engine が NVFP4 で最大 50 PFLOPS の推論性能を実現する。演算資源は Graphics Processor Cluster(GPC)+ 集中 L2 キャッシュにまとめられ、GigaThread Engine・MIG Control・NV-DEC が持続的な GPU 利用率を支える。 ## メモリ・接続性 - **HBM4**: 最大 288GB、専用 HBM コントローラ + 12-Hi スタックで最大 22 TB/s のピーク帯域幅(Blackwell/Blackwell Ultra 比 2.8 倍) - **TMA(Tensor Memory Accelerator)拡張版**: 複雑なデータレイアウト間の高効率データ移動を管理し、MoE 向けにはインライン・ディスクリプタ更新をサポート(全 expert で共有ディスクリプタを保持しつつメモリポインタ・ストライドのみをランタイム上書き) - **[[NVIDIA NVLink]] 6**: スケールアップ帯域 3,600 GB/s(NVLink Switch 経由の GPU 間 all-to-all 通信) - **NVLink-C2C**: コヒーレント CPU-GPU 通信に 1,800 GB/s - **PCIe Gen 6 (x16)**: ホスト接続に最大 256 GB/s - **Confidential Computing with TEE-I/O**: 静止・転送・使用中データの保護 ## 推論クリティカルパスの高速化技術 - **K 次元テンソルコアスループット倍増**: 1 クロックあたり処理できる K 次元データ量を倍にし、GEMM の K ループ反復回数を Blackwell 比半減(例: Blackwell 4 反復 → Rubin 2 反復)。テンソル並列度が高い場合の context/decode GEMM を効率化する - **アテンション高速化**: 密な $QK^T$ 計算後、Tensor Memory から構造化 2:4 スパース圧縮形式へロードして softmax・第 2 アテンション GEMM の演算/データ移動量を削減。指数関数スループットを Blackwell 比 FP32 で 2 倍・BF16/FP16 で 4 倍に向上 - **カーネル間依存の細粒度コーディネーション**: producer カーネルの広範な完了を待たず、データドリブンなポーリングでタイルレベルに consumer カーネルを早期開始し、カーネル間のアイドルギャップを削減 - **NVLink counted writes**: device-initiated 通信で受信側 GPU が転送完了をより効率的に追跡できるようにし、GPU 間データ移動の同期待ちを削減 ## 横断的知見 - **世代を跨ぐ「精度フォーマット拡張 → NVFP4 帯域倍増」路線の延長線上にある**: [[テンソルコア]] concept は Volta→Turing→Ampere→Hopper→Blackwell の精度サポート拡張(FP16→TF32→BF16→FP8)とテンソルメモリ(TMEM)の導入によるレジスタ圧力解消([[FlashAttention]] FA4)を横断的知見として蓄積してきた。Rubin の第 3 世代 Transformer Engine(NVFP4 で最大 50 PFLOPS)と K 次元スループット倍増は、この系譜の次の世代のデータ点であり、「テンソルコアの出力先・精度サポートが世代ごとに変わり、アルゴリズム設計を根本的に変える」という既存知見をさらに裏付ける。(Source: [[@2026__NVIDIA Developer Blog__Inside NVIDIA Rubin GPU Architecture Powering the Era of Agentic AI]], [[@2026__arXiv__FlashAttention-4 - Algorithm and Kernel Pipelining Co-Design for Asymmetric Hardware Scaling]]) ## 未解決の問い - Rubin の 2:4 構造化スパース圧縮によるアテンション高速化は、[[FlashAttention]] シリーズ(FA1-4)のカーネル設計にどう統合されるか。FA5 世代は Rubin の TMA インライン・ディスクリプタ更新やタイルレベル・カーネル間トリガリングを前提にした再設計になるか。 - NVFP4 50 PFLOPS という数値目標は、既存の FP8(Hopper/Blackwell)ベースの数値安定性知見(ブロック量子化等)をどう継承・変更するか。 - K 次元スループット倍増は GEMM 一般に効くとされるが、MoE の細粒度エキスパート(小さい K)ではどの程度恩恵が減衰するか。 ## 関連 - 親システム: [[NVIDIA Vera Rubin NVL72]] - 前世代: [[NVIDIA Blackwell|Blackwell]] - 開発元: [[NVIDIA]] - 関連 concept: [[テンソルコア]] / [[Mixture-of-Experts]] / [[KVキャッシュ管理]] / [[集合通信]] / [[カーネルフュージョン]] / [[FlashAttention]] ## 出典 - [[@2026__NVIDIA Developer Blog__Inside NVIDIA Rubin GPU Architecture Powering the Era of Agentic AI]]