# NVIDIA H100
NVIDIA の Hopper 世代データセンター GPU。AI、HPC、データ分析を主対象とし、SXM5 版は132 SM・528 Tensor Core・80GB HBM3・50MB L2 キャッシュ、PCIe 版は114 SM・456 Tensor Core・80GB HBM2e・50MB L2 キャッシュを備える。
第4世代 Tensor Core、FP8、[[Transformer Engine]]、[[DPX]]、[[Tensor Memory Accelerator]]、thread block cluster、[[分散共有メモリ]]、第4世代 [[NVLink]]、第2世代 [[GPU多重化(MPS・MIG)]] を主要な特徴とする。
[[NVIDIA Blackwell]] の GB203/[[RTX 5080]] と比較したマイクロベンチマークでは、H100 PCIe(GH100)が FP64、global memory 帯域、短い依存命令列、大規模 FP8 D-GEMMで有利な条件を示した。(Source: [[@2025__arXiv__Dissecting the NVIDIA Blackwell Architecture with Microbenchmarks]])
Grace CPU と組み合わせた [[NVIDIA GH200]] の GPU 部分にも使われる。
[[Preferred Elements]]の1Tパラメータ級MoE事前学習では、400基のH100を使用した。1台80GB、合計32TBのGPUメモリという構成は、1TパラメータのAdamWオプティマイザ状態だけで約12TBを要するというメモリ制約を可視化する。(Source: [[@2024__Preferred Networks__1兆 (1T) パラメータ規模のLLMの事前学習検証]])
公式発表時点の NVIDIA 比較では、A100 に対して Transformer Engine 利用時の AI 学習最大9倍、LLM 推論最大30倍、H100 SXM5 の HBM3 帯域3TB/s超を主張している。
これらはワークロード、精度、ネットワーク、バッチサイズを限定した暫定値であり、後続の H800 マイクロベンチマークでは FP8 や Transformer Engine の効果が行列サイズ・形式変換・メモリ律速性に依存することが示される。
## 関連
- 開発元: [[NVIDIA]]
- アーキテクチャ: [[NVIDIA Hopper]]
- 後継・関連: [[NVIDIA GH200]]
- concept: [[テンソルコア]] / [[混合精度訓練]] / [[NVLink]] / [[GPU最適化]]
## 出典
- [[@2022__NVIDIA Developer Blog__NVIDIA Hopper Architecture In-Depth]]
- [[@2024__arXiv__Benchmarking and Dissecting the Nvidia Hopper GPU Architecture]]