# NVIDIA GH200
[[NVIDIA]] の Grace Hopper Superchip。Grace CPU と Hopper GPU を NVLink-C2C(cache-coherent interconnect、900GB/s)で密結合し、単一パッケージで Hopper GPU の HBM(最大144GB)と Grace CPU の DRAM(最大480GB)をハードウェアコヒーレントな領域として扱える。PCIe Gen5 x16(~64-128GB/s)の約 7-14 倍の帯域を持つ。GH200 NVL2 構成では、各 Superchip が Hopper HBM 144GB + Grace DRAM 480GB を持つ 2 ソケット構成となる。(Source: [[@2026__MLSys2026__SuperInfer - SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips]])
GH200 は page-fault 駆動ではなくハードウェアアクセスカウンタに基づく Unified Memory(UM)ページマイグレーションもサポートするが、CPU 側 DRAM への直接アクセス帯域(C2C 経由でも DRAM 自体の 384GB/s に制限される「bandwidth cliff」)がボトルネックとなり、LLM サービングの KV キャッシュオフロード用途では素朴な UM 利用は不適切であることが SuperInfer の実験で示された。(Source: [[@2026__MLSys2026__SuperInfer - SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips]])
## 関連
- 本ソース: [[@2026__MLSys2026__SuperInfer - SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips]]
- 開発元: [[NVIDIA]]
- 関連 concept: [[KVキャッシュ管理]] / [[LLMサービング管理]]