# データセンター電力管理 ## 定義 データセンター電力管理は、電力供給設備、冷却、ラック、アクセラレータ、ワークロードの消費電力を観測・制約・制御し、設備の安全性と計算能力を両立させる運用である。AI訓練では同期した計算・通信位相が電力変動を生み、また電力供給階層の余力不均一性が実効的な計算容量を制限する。 ## 未解決の問い - ラックやGPUの電力平滑化で送電系統のランプ要件を満たしつつ、MSB・SB・RPPの階層制約に対する実行時の電力余力も最大限に回収する制御則は何か。 - 電力計測の粒度と遅延が異なるPSU、RPP、MSBの観測値を、ジョブ単位の電力上限制御へどのように統合すべきか。 - GFM ESS に求められるエネルギー容量(MWh)と充電状態の運用は、負荷脱落の周波数支援と訓練負荷の平滑化を両立するとき、どう決まるか。 - 系統運用者(NERC LLTF)は大規模負荷の高速記録データ・ダイナミックモデルの欠如を信頼性上の最重要リスクと位置づける。データセンター側の電力管理テレメトリ(GPU・ラック・PSU粒度の実測)を、系統運用者側が要求する可観測性(PMU水準の高分解能測定、動的モデル)へどう橋渡しできるか。(Source: [[@2025__NERC__Characteristics and Risks of Emerging Large Loads]]) ## 未編纂の観察 - **AI訓練の電力管理は、電力変動の安定化と階層的な電力余力の回収を同時に扱う必要がある**。 - 根拠: [[@2025__arXiv__Power Stabilization for AI Training Datacenters]]は、同期訓練に由来する0.2〜3 Hzの電力変動に対し、ソフトウェア、GPU、ラックの三層で平滑化する。 - 根拠: [[@2026__arXiv__Provisioning to Runtime Optimization of a 100 MW-Scale AI Cluster]]は、MSB・SB・RPPの余力を計画、配備後検証、実行時制御に接続し、Dimmerで電力供給装置に沿ってGPU上限を協調制御する。 - [定義] 100MW級の大規模AIデータセンターでは、単一アクセラレータのTDP最大化ではなく、固定受電電力枠(150MW)における性能対電力比とラック収容密度のトレードオフ最適化(例: GB200を1200Wから960Wへ制限してクラスタ配備台数を増やす)により、クラスタ総計算スループットが+9%〜+11%向上する。(Source: [[@2026__arXiv__Provisioning to Runtime Optimization of a 100 MW-Scale AI Cluster]]) - [定義] サーバ群の電力集約粒度(ラック vs クラスタ vs データセンター)によって安全な電力マージンは激変する。ラック単位(数十台)のオーバーサブスクリプションは同時ピークによる遮断器トリップのリスクが高い一方、クラスタ(数千台)やデータセンター全体では統計的多様性により17%〜39%の追加マシンを安全に配備できる。(Source: [[@2007__ISCA__Power Provisioning for a Warehouse-sized Computer]]) - 電力平滑化を GPU・ラック側の制御で行う従来の議論に対し、系統・共設発電機側では 800 MW 級のグリッドフォーミング ESS が負荷脱落後の周波数(61.98 Hz → 61.25 Hz)と 16 Hz 訓練負荷の軸ねじりトルクを抑える。ITE 側の GPU 平滑化だけでは軸疲労限界を守れないと著者らは述べる。(Source: [[@2026__ACCESS__Using Grid-Forming Energy Storage Systems to Provide Dynamic Active Power Support for Hyperscale Data Center]], [[@2025__arXiv__Power Stabilization for AI Training Datacenters]]) - 系統運用者側の実測でも、AIトレーニング負荷は既知のGPU・ラック単位の平滑化制御の前提を上回る速度でランプしうる。(Source: [[@2025__NERC__Characteristics and Risks of Emerging Large Loads]])は、200MW級AIトレーニングデータセンターの50MWブロックが訓練開始時に最大1.9 p.u./秒(約250ミリ秒間)でランプし、世界最大級とされるxAI Colossus Supercomputerでは1分未満で35〜70MW以上の負荷変化が生じ、エリア制御誤差(ACE)へ影響しうると報告する。 - AIトレーニング用データセンターの電力供給系は、IT機器向けUPS保護を意図的に省略し、定期的なチェックポイント保存・復元で電源断への耐性を代替する設計が一般化している。従来型データセンターのTier分類(UPS・冗長発電を前提)とは異なる電源保護思想であり、GPU・ラック側の電力平滑化制御が瞬断時の電源継続性を前提にできない場合がある。(Source: [[@2025__NERC__Characteristics and Risks of Emerging Large Loads]]) - 設備側の電力監視(受電盤・UPS・PDU/RPP・バスウェイ)は、容量計画、回路の負荷バランス、チャージバック、予知保全に使う階層構造として整理される。ホワイトペーパーは運用者とテナント間でこれらの点を共有する標準を求める。(Source: [[@2025__OCP__Third Party Integration, Telemetry & APIs]]) ## 関連 - 概念: [[RDMA]] / [[GPUクラスタ運用]] / [[LLM分散学習]] / [[データセンターテレメトリ]] - ソース: [[@2007__ISCA__Power Provisioning for a Warehouse-sized Computer]] / [[@2026__ACCESS__Using Grid-Forming Energy Storage Systems to Provide Dynamic Active Power Support for Hyperscale Data Center]] / [[@2025__NERC__Characteristics and Risks of Emerging Large Loads]] - エンティティ: [[NERC]] / [[ERCOT]] ## 出典 - [[@2025__arXiv__Power Stabilization for AI Training Datacenters]] - [[@2026__arXiv__Provisioning to Runtime Optimization of a 100 MW-Scale AI Cluster]] - [[@2026__ACCESS__Using Grid-Forming Energy Storage Systems to Provide Dynamic Active Power Support for Hyperscale Data Center]](系統側から見た大規模負荷脱落と共設発電機の軸疲労を、GFM ESS で緩和する EMT 検討) - [[@2025__OCP__Third Party Integration, Telemetry & APIs]](電力監視の階層と共有要件)