# NVIDIA GH200 [[NVIDIA]] の Grace Hopper Superchip。Grace CPU と Hopper GPU を NVLink-C2C(cache-coherent interconnect、900GB/s)で密結合し、単一パッケージで Hopper GPU の HBM(最大144GB)と Grace CPU の DRAM(最大480GB)をハードウェアコヒーレントな領域として扱える。PCIe Gen5 x16(~64-128GB/s)の約 7-14 倍の帯域を持つ。GH200 NVL2 構成では、各 Superchip が Hopper HBM 144GB + Grace DRAM 480GB を持つ 2 ソケット構成となる。(Source: [[@2026__MLSys2026__SuperInfer - SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips]]) GH200 は page-fault 駆動ではなくハードウェアアクセスカウンタに基づく Unified Memory(UM)ページマイグレーションもサポートするが、CPU 側 DRAM への直接アクセス帯域(C2C 経由でも DRAM 自体の 384GB/s に制限される「bandwidth cliff」)がボトルネックとなり、LLM サービングの KV キャッシュオフロード用途では素朴な UM 利用は不適切であることが SuperInfer の実験で示された。(Source: [[@2026__MLSys2026__SuperInfer - SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips]]) 「Over the Memory Wall, Into the Instruction Wall」(arXiv 2026)は、GH200の単一GPU部分(H100 SXM相当のHopperアーキテクチャ)をNVIDIA L4と比較する形でGPUデータベースの性能分析に用いた。GH200はL4に対しメモリ帯域幅13.4倍・命令スループット2.5倍という非対称な増加を持ち、この非対称性がRoofline上のridge line(演算バウンドとメモリバウンドの境界)をL4の44.0 inst./sectorからGH200の8.3 inst./sectorへ大きくシフトさせる。この結果、[[cuDF]]カーネルの実行時間の77.5%がGH200上では演算(命令スループット)バウンドに転じ、L4では逆に74.1%がメモリバウンドのままだった。(Source: [[@2026__arXiv__Over the Memory Wall, Into the Instruction Wall - The New Bottleneck in GPU Data Processing]] §3.1, §5) ## 関連 - 本ソース: [[@2026__MLSys2026__SuperInfer - SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips]] / [[@2026__arXiv__Over the Memory Wall, Into the Instruction Wall - The New Bottleneck in GPU Data Processing]] - 開発元: [[NVIDIA]] - 関連 concept: [[KVキャッシュ管理]] / [[LLMサービング管理]] / [[Rooflineモデル]]