# 動的電力共有 ## 定義 動的電力共有(Dynamic Power Sharing)とは、CPUコアとGPUコンピュートユニット、あるいは複数のアクセラレータダイが単一の電源供給枠または冷却限界を共有する高密度プロセッサにおいて、各計算ユニットのリアルタイムな負荷状態に応じて、全体の熱設計電力(TDP)枠内で利用可能電力を動的に再配分・融通する制御機構である。([[@2026__HPCA__GPU Partitioning, Power, and Performance of the AMD MI300A]]) ## 制御機構とスロットリングの非対称性 1. **ワークロード負荷に応じた電力シフト**: 一方の処理装置(例: CPU)が低負荷・アイドル状態にある場合、余剰電力をもう一方(例: GPU)へ割り当てることで、最大ブースト周波数の維持を可能にする。 2. **TDP到達時の周波数スロットリング**: 全体消費電力がTDP(MI300Aでは550W)に到達すると、ハードウェアおよびファームウェアの熱管理機構(DVFS)が作動し、クロック周波数を段階的(例: 5%, 10%, 20%)に引き下げる。 3. **ワークロード特性による脆弱性の差異**: - **FLOP制約(計算律速)カーネル**: クロック周波数の低下が直接演算性能の低下に直結するため、最大20%の深刻な性能劣化を被る。 - **メモリ制約(帯域律速)カーネル**: メモリクロック(HBM)が維持される限り、グラフィックス周波数の低下による影響をほとんど受けない。 ## 課題とトレードオフ - **コ・ロケーション時のノイズ源**: 複数プロセスが同一APU内の異なるダイで実行される際、高電力消費ジョブ(ZGEMM等)の存在が隣接プロセスの動作周波数を引き下げる「電力干渉(Power Interference)」を引き起こす。 - **テレメトリ解像度**: ハードウェア制御ループ(ミリ秒未満)に対して、外部管理インターフェース(1 Hz等)の監視解像度が低いため、過渡的な電力挙動の精密なモデリングが困難である。 ## 関連 - ソース: [[@2026__HPCA__GPU Partitioning, Power, and Performance of the AMD MI300A]] - 概念: [[電力管理]] / [[GPUエネルギー効率]] / [[Rooflineモデル]] / [[APU]] / [[GPUパーティショニング]] - エンティティ: [[AMD Instinct MI300A]] ## 未編纂の観察 - **高負荷ジョブによる電力上限飽和は全ダイ稼働を待たずに発生する**: MI300Aにおいて、極めて計算集約的なZGEMMを3プロセス(6ダイ中3ダイ)走らせるだけでAPU全体電力が550W TDP上限に到達し、周波数スロットリングが発動する。全ダイが稼働していなくとも計算律速カーネルは減速を受ける。(Source: [[@2026__HPCA__GPU Partitioning, Power, and Performance of the AMD MI300A]]) ## 未解決の問い - 異種ジョブ混在スケジューリングにおいて、ジョブの計算集約度(FLOP/Byte比)を事前計測して電力相補的なペアを同一APUに割り当てることで、スロットリングを完全に回避できるか。