# NVIDIA GH200 [[NVIDIA]] の Grace Hopper Superchip。Grace CPU と Hopper GPU を NVLink-C2C(cache-coherent interconnect、900GB/s)で密結合し、単一パッケージで Hopper GPU の HBM(最大144GB)と Grace CPU の DRAM(最大480GB)をハードウェアコヒーレントな領域として扱える。PCIe Gen5 x16(~64-128GB/s)の約 7-14 倍の帯域を持つ。GH200 NVL2 構成では、各 Superchip が Hopper HBM 144GB + Grace DRAM 480GB を持つ 2 ソケット構成となる。(Source: [[@2026__MLSys2026__SuperInfer - SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips]]) GH200 は page-fault 駆動ではなくハードウェアアクセスカウンタに基づく Unified Memory(UM)ページマイグレーションもサポートするが、CPU 側 DRAM への直接アクセス帯域(C2C 経由でも DRAM 自体の 384GB/s に制限される「bandwidth cliff」)がボトルネックとなり、LLM サービングの KV キャッシュオフロード用途では素朴な UM 利用は不適切であることが SuperInfer の実験で示された。(Source: [[@2026__MLSys2026__SuperInfer - SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips]]) ## 関連 - 本ソース: [[@2026__MLSys2026__SuperInfer - SLO-Aware Rotary Scheduling and Memory Management for LLM Inference on Superchips]] - 開発元: [[NVIDIA]] - 関連 concept: [[KVキャッシュ管理]] / [[LLMサービング管理]]