# NVIDIA H100 NVIDIA の Hopper 世代データセンター GPU。AI、HPC、データ分析を主対象とし、SXM5 版は132 SM・528 Tensor Core・80GB HBM3・50MB L2 キャッシュ、PCIe 版は114 SM・456 Tensor Core・80GB HBM2e・50MB L2 キャッシュを備える。 第4世代 Tensor Core、FP8、[[Transformer Engine]]、[[DPX]]、[[Tensor Memory Accelerator]]、thread block cluster、[[分散共有メモリ]]、第4世代 [[NVLink]]、第2世代 [[GPU多重化(MPS・MIG)]] を主要な特徴とする。 [[NVIDIA Blackwell]] の GB203/[[RTX 5080]] と比較したマイクロベンチマークでは、H100 PCIe(GH100)が FP64、global memory 帯域、短い依存命令列、大規模 FP8 D-GEMMで有利な条件を示した。(Source: [[@2025__arXiv__Dissecting the NVIDIA Blackwell Architecture with Microbenchmarks]]) Grace CPU と組み合わせた [[NVIDIA GH200]] の GPU 部分にも使われる。 [[Preferred Elements]]の1Tパラメータ級MoE事前学習では、400基のH100を使用した。1台80GB、合計32TBのGPUメモリという構成は、1TパラメータのAdamWオプティマイザ状態だけで約12TBを要するというメモリ制約を可視化する。(Source: [[@2024__Preferred Networks__1兆 (1T) パラメータ規模のLLMの事前学習検証]]) 公式発表時点の NVIDIA 比較では、A100 に対して Transformer Engine 利用時の AI 学習最大9倍、LLM 推論最大30倍、H100 SXM5 の HBM3 帯域3TB/s超を主張している。 これらはワークロード、精度、ネットワーク、バッチサイズを限定した暫定値であり、後続の H800 マイクロベンチマークでは FP8 や Transformer Engine の効果が行列サイズ・形式変換・メモリ律速性に依存することが示される。 ## 関連 - 開発元: [[NVIDIA]] - アーキテクチャ: [[NVIDIA Hopper]] - 後継・関連: [[NVIDIA GH200]] - concept: [[テンソルコア]] / [[混合精度訓練]] / [[NVLink]] / [[GPU最適化]] ## 出典 - [[@2022__NVIDIA Developer Blog__NVIDIA Hopper Architecture In-Depth]] - [[@2024__arXiv__Benchmarking and Dissecting the Nvidia Hopper GPU Architecture]]