# GPUエネルギー効率
## 定義
GPUアクセラレータ上でのLLM/VLMの訓練・推論において、計算スループット(TFLOPs/GPU等)あたりでなく、消費電力・エネルギーあたりでどれだけ有用な計算量を達成できるかを表す性質。TFLOPs/kW(電力あたり計算効率)やtokens-per-kilojoule(エネルギーあたり生成トークン数)といった指標で定量化される(Source: [[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]])。計算効率(compute efficiency)とエネルギー効率(energy efficiency)は独立した軸であり、両者が乖離する現象は「計算-エネルギー不整合(compute–energy misalignment)」と呼ばれる(Source: [[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]])。
## 横断的知見
- **世代・アーキテクチャが新しい/高性能なGPUほど、スループットは上がるがエネルギー効率は下がりうる**。[[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]]はNVIDIA B200がH100比でTFLOPs/GPU最大32%高いにもかかわらず、LLM訓練5モデル全てでTFLOPs/kWとtokens-per-kilojouleがH100を下回ることを実測した。[[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]]でも、専用データフローアクセラレータ(CS-3・SN40L)は小バッチ推論でGPU比1桁のスループット・レイテンシ優位を示す一方、トークン/Jのエネルギー効率ではGPUを下回るという同型のトレードオフが観察されている。両ソースとも「スループット優位 ⇏ エネルギー効率優位」という命題を、訓練(MDPI論文)・推論(IPDPS論文)という異なるフェーズで独立に裏付けている(Source: [[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]], [[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]])。
- **NVIDIA H100はエネルギー効率の基準点として複数ソースで良好な評価を得ている**。[[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]]は評価対象GPUの中でH100が最高のスループットとエネルギー効率を達成したと報告し、[[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]]も訓練においてH100がB200よりTFLOPs/kW・tokens-per-kilojouleで一貫して優位であることを示す。推論・訓練の両フェーズでH100の電力効率の高さが独立に確認されている(Source: [[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]], [[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]])。
- **エネルギー効率はワークロードの演算密度に強く依存し、モデル横断で一様ではない**。[[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]]では、軽量な畳み込み・疎注意カーネルに依存するVLM(X-CLIP・EVL)はB200の高いベースライン消費電力の恩恵を受けられずエネルギー効率が悪化するが、演算強度の高いVita-CLIPはB200で訓練時間・総エネルギー消費の両方が改善する例外を示した。同様に[[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]]でも、Mixture-of-Expertsモデルの計算効率向上幅がスパース性に反比例するなど、モデル構造によって効率化の効果が非一様であることが示されている(Source: [[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]], [[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]])。
- **バッチング(資源効率)と DVFS(電力効率)は、SLO レイテンシスラックという単一の有限予算を奪い合う結合軸であり、片方を固定した最適化は局所最適にしか到達しない**。[[@2026__MLSys__BEAM - Joint Resource-Power Optimization for Energy-Efficient LLM Inference under SLO constraints]]は Energy = Time × Power の分解に対応する2軸として資源効率(バッチング/チャンクサイズ/マイクロバッチ数)と電力効率(DVFS)を定式化し、最適な GPU 周波数がバッチサイズ・チャンクサイズに応じて非線形にシフトする「エネルギー最適谷」の位置が変わることを実測で示した。これは本 concept が蓄積してきた「スループット優位 ⇏ エネルギー効率優位」という命題(GPU 世代間比較)を、同一 GPU 上の実行時制御ノブ間の結合という、より細かい粒度で裏付けるものである(Source: [[@2026__MLSys__BEAM - Joint Resource-Power Optimization for Energy-Efficient LLM Inference under SLO constraints]])。
- **LLM 推論のエネルギー最適化は、GPU クロック単独のノブから解放し、パイプライン並列のスケジューリングノブ(チャンクサイズ・マイクロバッチ数)まで含めてミリ秒粒度で共最適化する方向に進んでいる**。DynamoLLM(HPCA 2025)がクラスタ規模・秒単位の粗粒度で資源・電力を同時考慮した最初の試みだったのに対し、BEAM はパイプライン並列内部の細粒度ノブとイベント駆動制御(リクエスト到着・完了ごとの即時判断)を組み合わせることで、バースト的な負荷変動への応答をミリ秒級に短縮した。これは省エネアーキテクチャの最適化粒度が「クラスタ→ノード→パイプラインステージ」へと下がりつつある傾向を示す(Source: [[@2026__MLSys__BEAM - Joint Resource-Power Optimization for Energy-Efficient LLM Inference under SLO constraints]])。
- **性能デバッグの改善効果は、訓練時間と電力の同時削減として運用指標へ現れる**: [[Zoomer]] は 2024 年の Ads 関連モデルで訓練時間 75% 短縮と電力消費 78% 削減を報告し、推論では GPU/CPU ボトルネックの検知とパラメータ調整により電力消費 10〜45% 削減を報告する。これは専用の電力制御器だけでなく、GPU 利用率、メモリ帯域、通信、サービングパラメータを横断して性能ボトルネックを除去することがエネルギー効率へ波及する実運用例である。ただし記事は測定条件と比較対象を明示していないため、既存研究の再現可能なエネルギーメトリクスとは証拠の粒度が異なる。(Source: [[@2025__EngineeringAtMeta__Zoomer - Powering AI Performance at Meta's Scale Through Intelligent Debugging and Optimization]])
- [利用率メトリクスと電力消費の相関] `nvmlDeviceGetTotalEnergyConsumption`による継続積算電力カウンタとの線形相関を比較すると、`nvidia-smi`のGPU利用率(相関0.79、MAPE 32.27%)より、NVML GPMのSM利用率(相関0.95、MAPE 15.40%)の方が有意に強い。電力消費はアクティブなワープ数(SM占有率、相関0.84)よりアクティブなSM数(SM利用率)に強く依存し、継続積算カウンタに基づくGPMメトリクスの方が瞬時サンプリングの`nvidia-smi`よりサンプル間の情報損失が少ない。(Source: [[@2026__SCAHPCAsiaWS__Leveraging NVML GPM for NVIDIA GPU Monitoring]])
- [ジョブ型と総エネルギー] 同じ GPU-hours ビン内で比較すると、メモリバウンドと判定されたジョブの総エネルギー分布がコンピュートバウンドより高い側に寄る。著者はこれをスケジューリング信号として使う余地があると述べる(Source: [[@2026__IPDPS__Characterizing Production GPU Workloads using System-wide Telemetry Data]])。
## 未解決の問い
- BEAM のような細粒度・ミリ秒級の DVFS+バッチング共最適化は、H100/B200 のような新世代 GPU のエネルギー谷カーブでも同様に機能するか。本 concept の他ソースが示す「新世代 GPU ほどエネルギー効率が悪化しうる」傾向と、BEAM のオフラインプロファイリング(30分/GPU構成)がどう相互作用するかは未検証([[@2026__MLSys__BEAM - Joint Resource-Power Optimization for Energy-Efficient LLM Inference under SLO constraints]]は A100 のみで評価)。
- power-capped構成(電力上限を設定した運用)は、B200のようなベースライン消費電力が高いアクセラレータのエネルギー効率をどの程度改善するか。訓練スループットとのトレードオフはどう定量化されるか([[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]]が今後の課題として明記)。
- FSDP/ZeRO等のマルチノード・メモリ効率シャーディング手法を用いた場合、通信オーバーヘッドの増加がTFLOPs/kWやtokens-per-kilojouleにどう影響するか(現状はシングルノードDDP訓練の実測のみ)。
- 訓練フェーズ(本concept収録の[[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]])と推論フェーズ(prefill/decode、[[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]])でのエネルギー効率トレンドは、同一アクセラレータ世代間でどこまで整合するか。
- データセンター施設規模のPUE改善(液冷等)は、ノードレベルの電力超過をどこまで相殺できるか。実測ベースのPUE検証はまだ不足している([[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]]のPUE値はシナリオ仮定)。
- GPU-hours 正規化後のエネルギー差を、電力キャップやジョブ配置のオンライン制御に使う場合、10 秒テレメトリの遅延と誤分類は制御品質をどこまで損なうか。
## 関連
- [[GPUクラスタ運用]] — GPUクラスタの信頼性・スケジューリング・利用率の観点からの関連概念。
- [[AIアクセラレータ]] — GPUと専用データフローアクセラレータのアーキテクチャ比較。
- [[GPU最適化]] — ソフトウェアレベルのGPU性能最適化技法。
- ソース: [[@2026__SCAHPCAsiaWS__Leveraging NVML GPM for NVIDIA GPU Monitoring]] / [[@2026__IPDPS__Characterizing Production GPU Workloads using System-wide Telemetry Data]]
- 概念: [[メモリバウンド]] / [[GPU観測性]]
## 出典
- [[@2026__AI__Scalable and Energy-Efficient AI - System-Level Profiling of NVIDIA GPU Clusters for Distributed LLM Training]]
- [[@2026__IPDPS__Beyond Throughput - Performance and Energy Insights of LLM Inference Across AI Accelerators]]
- [[@2026__MLSys__BEAM - Joint Resource-Power Optimization for Energy-Efficient LLM Inference under SLO constraints]]
- [[@2026__IPDPS__Characterizing Production GPU Workloads using System-wide Telemetry Data]](同等 GPU-hours でのジョブ型別エネルギー)