# GPUエネルギー効率 ## 定義 GPUアクセラレータ上でのLLM/VLMの訓練・推論において、計算スループット(TFLOPs/GPU等)あたりでなく、消費電力・エネルギーあたりでどれだけ有用な計算量を達成できるかを表す性質。TFLOPs/kW(電力あたり計算効率)やtokens-per-kilojoule(エネルギーあたり生成トークン数)といった指標で定量化される(Source: [[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]])。計算効率(compute efficiency)とエネルギー効率(energy efficiency)は独立した軸であり、両者が乖離する現象は「計算-エネルギー不整合(compute–energy misalignment)」と呼ばれる(Source: [[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]])。 ## 横断的知見 - **世代・アーキテクチャが新しい/高性能なGPUほど、スループットは上がるがエネルギー効率は下がりうる**。[[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]]はNVIDIA B200がH100比でTFLOPs/GPU最大32%高いにもかかわらず、LLM訓練5モデル全てでTFLOPs/kWとtokens-per-kilojouleがH100を下回ることを実測した。[[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]]でも、専用データフローアクセラレータ(CS-3・SN40L)は小バッチ推論でGPU比1桁のスループット・レイテンシ優位を示す一方、トークン/Jのエネルギー効率ではGPUを下回るという同型のトレードオフが観察されている。両ソースとも「スループット優位 ⇏ エネルギー効率優位」という命題を、訓練(MDPI論文)・推論(IPDPS論文)という異なるフェーズで独立に裏付けている(Source: [[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]], [[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]])。 - **NVIDIA H100はエネルギー効率の基準点として複数ソースで良好な評価を得ている**。[[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]]は評価対象GPUの中でH100が最高のスループットとエネルギー効率を達成したと報告し、[[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]]も訓練においてH100がB200よりTFLOPs/kW・tokens-per-kilojouleで一貫して優位であることを示す。推論・訓練の両フェーズでH100の電力効率の高さが独立に確認されている(Source: [[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]], [[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]])。 - **エネルギー効率はワークロードの演算密度に強く依存し、モデル横断で一様ではない**。[[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]]では、軽量な畳み込み・疎注意カーネルに依存するVLM(X-CLIP・EVL)はB200の高いベースライン消費電力の恩恵を受けられずエネルギー効率が悪化するが、演算強度の高いVita-CLIPはB200で訓練時間・総エネルギー消費の両方が改善する例外を示した。同様に[[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]]でも、Mixture-of-Expertsモデルの計算効率向上幅がスパース性に反比例するなど、モデル構造によって効率化の効果が非一様であることが示されている(Source: [[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]], [[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]])。 ## 未解決の問い - power-capped構成(電力上限を設定した運用)は、B200のようなベースライン消費電力が高いアクセラレータのエネルギー効率をどの程度改善するか。訓練スループットとのトレードオフはどう定量化されるか([[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]]が今後の課題として明記)。 - FSDP/ZeRO等のマルチノード・メモリ効率シャーディング手法を用いた場合、通信オーバーヘッドの増加がTFLOPs/kWやtokens-per-kilojouleにどう影響するか(現状はシングルノードDDP訓練の実測のみ)。 - 訓練フェーズ(本concept収録の[[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]])と推論フェーズ(prefill/decode、[[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]])でのエネルギー効率トレンドは、同一アクセラレータ世代間でどこまで整合するか。 - データセンター施設規模のPUE改善(液冷等)は、ノードレベルの電力超過をどこまで相殺できるか。実測ベースのPUE検証はまだ不足している([[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]]のPUE値はシナリオ仮定)。 ## 関連 - [[GPUクラスタ運用]] — GPUクラスタの信頼性・スケジューリング・利用率の観点からの関連概念。 - [[AIアクセラレータ]] — GPUと専用データフローアクセラレータのアーキテクチャ比較。 - [[GPU最適化]] — ソフトウェアレベルのGPU性能最適化技法。 ## 出典 - [[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]] - [[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]]