# Provisioning to Runtime Optimization of a 100 MW-Scale AI Cluster
> [!abstract] 概要
> AIデータセンターへの電力供給は、現在、AIアクセラレータの可用性という制約さえ上回り、汎用人工知能(AGI)をめぐる競争における最も重要なボトルネックとなっている。
> 私たちの知る限り、本論文は、次世代アクセラレータが一般に利用可能になる6〜12か月前にそれを収容するための初期電力計画、大規模配備後の電力設定調整、さらに変化するワークロードに対する動的な実行時電力管理までを含む、ハイパースケールAIデータセンターのエンドツーエンド電力管理過程を初めて記述する。
> RDMAバックエンドネットワークで接続された83K台のGB200 GPUクラスタを収容する150 MWデータセンターについて、詳細な電力測定を提示する。
> この最先端AIクラスタを構築して得た知見を共有する。
> 本研究が業界全体の実務者に自らの経験を共有する契機となることを期待する。
## 論文情報
- **タイトル**: Provisioning to Runtime Optimization of a 100 MW-Scale AI Cluster
- **著者**: [[Ehsan K. Ardestani]] ほか計23名
- **所属**: [[Meta Platforms]]
- **媒体**: arXiv:2605.24461v2 [cs.DC], 2026年5月26日改訂
- **対象規模**: 150 MW データセンター(5棟×30 MW)、83,000基超の NVIDIA GB200 GPU、RDMA 800 Gbps バックエンドネットワーク
---
## 概要
超巨大 AI クラスタにおける**「電力制約下のスループット最大化」を、施設計画から本番運用までエンドツーエンドで実証した金字塔的論文**。
Meta が設計・構築した 150 MW・83,000基超の NVIDIA GB200 NVL72 クラスタの実運用データに基づき、「GPU を最大定格電力(1,200W TDP)で動かすことは、データセンター全体の計算能力を最大化しない」という衝撃的な事実を数理的・実験的に証明した。
次世代 GPU の入手前に初期配備台数と電力上限を策定する**「計画段階」**、実機の PSU テレメトリのバイアスをオシロスコープや DCIM 測定で較正する**「配備後検証段階」**、そして電力供給階層の限界直前で協調キャッピングを行うランタイム制御基盤「Dimmer」による**「実行時制御段階」**の 3 つのフェーズを一気通貫で設計。150 MW の固定受電枠の中で、クラスタ全体の実効スループットを **+14% 以上** 向上させることに成功した。
---
## 問題設定と最適化の定式化
### 1. 制約条件:電力供給階層と機械設備
受電契約電力 $P_{\text{total}}$(150 MW)は固定されており、これを IT 設備(GPU、CPU、ネットワーク)と機械設備(Chiller、CRAH、ポンプ等の冷却系電力)で分け合う。
**Table 1: 最適化モデルにおける主要記号と定義**
![[_attachments/arxiv-2605.24461/table01-notation.png]]
(Table 1. GPU 電力上限 $p$、GPU 単体正規化性能 $f(p)$、ラック総電力 $g(p)$、配備可能 GPU 台数 $N(p)$、および電力配分階層(MSB, SB, RPP)の集合と容量制約の定義。)
### 2. クラスタ総スループットの最大化問題
目的は、電力供給階層の各制約を満たしながら、クラスタ全体の総計算スループット $T(p)$ を最大化することである:
$\max_{p} T(p) = N(p) \cdot f(p)$
制約条件:
$N(p) \cdot g(p) + P_{\text{mechanical}} + P_{\text{network}} \le P_{\text{total}}$
GPU 単体の性能 $f(p)$ は電力に対して限界効用が逓減(凹関数)する。一方、GPU の電力上限 $p$ を下げるとラック電力 $g(p)$ が減少し、同じ 150 MW の電力枠内に**より多くの GPU ノードを詰め込む($N(p)$ を増やす)** ことができる。したがって、$\frac{f(p)}{g(p)}$ が最大となる最適動作点 $p^*$ が存在する。
---
## ハードウェア構成とクラスタアーキテクチャ
### 1. Catalina GB200 ポッド構成
**Figure 1 & 4: Catalina GB200 ポッドの論理構成と実機外観**
![[_attachments/arxiv-2605.24461/fig01-catalina-pod-configuration.png]]
![[_attachments/arxiv-2605.24461/fig04-catalina-pod-photo.png]]
(Figure 1, 4. 2 つの IT ラックに計 72 基の NVIDIA GB200 GPU を収容(NVLink ドメイン)。ラック背面には 2 基の空気支援液冷(AALC: Air-Assisted Liquid Cooling)ドアが設置され、高密度な直接液冷除熱を行う。)
**Table 2: Catalina GB200 ラックの電力積み上げ見積もり**
![[_attachments/arxiv-2605.24461/table02-rack-power.png]]
(Table 2. GPU、Grace CPU、ConnectX NIC、NVMe ストレージ、NVSwitch、PSU 変換損失、および AALC 冷却ファンの各寄与度とデレーティング係数。)
### 2. バックエンド RDMA ネットワーク
**Figure 2 & 3: バックエンドネットワーク構成と帯域スケーリング効果**
![[_attachments/arxiv-2605.24461/fig02-backend-network.png]]
![[_attachments/arxiv-2605.24461/fig03-bandwidth-scaling.png]]
(Figure 2. Rack Switch, Fabric Switch, Spine Switch の 3 階層 Fat-Tree。Packet Spraying により ECMP のハッシュ偏りを解消。Figure 3. GPU あたり帯域を 50 GB/s から 100 GB/s(800 Gbps)へ増強することで、数万 GPU 規模での集合通信ボトルネックを大幅に解消。)
**Table 3: バックエンドネットワークの電力配分**
![[_attachments/arxiv-2605.24461/table03-backend-network-power.png]]
(Table 3. スイッチ台数と平均消費電力からバックエンドネットワーク全体の電力を精緻に算出。)
---
## 電力供給階層と冷却の動的相互作用
**Figure 5: 電力供給階層(MSB $\to$ SB $\to$ RPP $\to$ Rack)**
![[_attachments/arxiv-2605.24461/fig05-power-distribution-hierarchy.png]]
(Figure 5. 主配電盤(MSB: Main Switch Board)からサブ配電盤(SB)、リモート電源盤(RPP)を経て各ラックへ至るツリー構造。異種ラックの混在により局所的な電力余力の不均一性が生じる。)
**Figure 6: MSB における機械冷却設備ピーク電力の季節推移**
![[_attachments/arxiv-2605.24461/fig06-mechanical-power-peak.png]]
(Figure 6. 1 つの MSB における機械冷却系電力の年間推移。夏季の外気温・湿球温度の上昇に伴いチラー・冷却塔の消費電力が増大し、IT 機器に回せる実効電力が季節変動する。)
---
## 3 段階の電力管理ライフサイクルと実験結果
### フェーズ 1: 計画段階の最適化(1,200W $\to$ 960W)
**Figure 7 & 8: 演算強度別の FLOPS 感度および HBM 帯域の電力感度**
![[_attachments/arxiv-2605.24461/fig07-flops-power-sensitivity.png]]
![[_attachments/arxiv-2605.24461/fig08-hbm-bandwidth-sensitivity.png]]
(Figure 7. 演算強度が約 1,500 以下のワークロードでは、GPU 電力上限を下げても FLOPS がほとんど低下しない。Figure 8. HBM 帯域は 1,000 W 以上では完全に一定であり、800 W を下回ると急減する。)
**Figure 9: 固定電力予算における GPU 電力上限とクラスタ総スループット**
![[_attachments/arxiv-2605.24461/fig09-cluster-throughput-power.png]]
(Figure 9. 1,200 W から 1,000 W へ下げると単体性能は 5% 低下するが電力が 16.7% 減るため、配備台数が増えてクラスタ総スループットは **+9% 向上** する。900 W でも +6% 向上。Meta が計画値として採用したのは **960 W(最大 TDP の 80%)**。)
**Table 4: 150 MW データセンターにおける世代・電力設定別の配分比較**
![[_attachments/arxiv-2605.24461/table04-datacenter-allocation.png]]
(Table 4. H100 700W 基準に対し、GB200 960W は物理 GPU 数約 86,000 基を収容し、総スループットは **1.9 倍**。GB200 1,200W と比較してもクラスタ総スループットは約 **11% 高い**。)
### フェーズ 2: 配備後検証とテレメトリ較正(960W $\to$ 1,020W)
**Figure 10, 11, 12, 13: PSU 測定の系統誤差と集約統計量の較正**
![[_attachments/arxiv-2605.24461/fig10-power-validation.png]]
![[_attachments/arxiv-2605.24461/fig11-psu-oscilloscope-comparison.png]]
![[_attachments/arxiv-2605.24461/fig12-psu-aggregation-comparison.png]]
![[_attachments/arxiv-2605.24461/fig13-aggregation-error.png]]
(Figure 10, 11. ラック PSU の内部電力計は AC オシロスコープ実測値に対して系統的に過大評価(保守的報告)する。Figure 12, 13. 1分間の PSU サンプルの **P70(70パーセンタイル)** が、RPP の DCIM 最大値に最も低い誤差で一致することを特定。)
**Figure 14 & 15: MSB および RPP における静的計画余力(Headroom)の累積分布**
![[_attachments/arxiv-2605.24461/fig14-msb-headroom.png]]
![[_attachments/arxiv-2605.24461/fig15-rpp-headroom.png]]
(Figure 14, 15. MSB の平均余力は約 160 kW(GPU あたり 100 W)、RPP の平均余力は 26 kW(GPU あたり 200 W)。ボトルネックは主に MSB 側に存在する。)
**Figure 16: Dense Transformer 実行時のラック電力分布**
![[_attachments/arxiv-2605.24461/fig16-rack-power-distribution.png]]
(Figure 16. テレメトリの較正により、安全に運用上限を 960 W から **1,020 W** へ引き上げ、期待ワークロードの性能を **+2.0〜3.0%** 追加回収。)
### フェーズ 3: 実行時制御「Dimmer」と電力平滑化
**Figure 17 & 18: ソフトウェア電力平滑化カーネルの挙動**
![[_attachments/arxiv-2605.24461/fig17-power-smoother-draw.png]]
![[_attachments/arxiv-2605.24461/fig18-power-smoother-region.png]]
(Figure 17, 18. Tensor Core にレジスタ内データのみで命令を発行する平滑化カーネル。最大 800 W/GPU を瞬時に消費し、学習休止時の電力急落を防止。主ワークロードへの影響は 3% 未満。)
**Figure 19: 同期学習ジョブにおける局所的キャッピングの弊害(ストラグラー現象)**
![[_attachments/arxiv-2605.24461/fig19-job-power-capping-impact.png]]
(Figure 19. 1 台のホストだけをキャッピングすると、全 GPU がその完了待ちとなってクラスタ全体の電力が共倒れする。キャッピングは供給装置配下の全ノードに協調適用しなければならない。)
**Figure 20: 階層的ランタイム制御「Dimmer」のケーススタディ**
![[_attachments/arxiv-2605.24461/fig20-dimmer-case-study.png]]
(Figure 20. 装置定格の 97% 超過時に発動。高優先度ジョブの突発ピークに対し、低優先度ジョブの GPU 上限を安全に絞り込み、平均電力を約 7% 引き下げてトリップを回避。)
---
## 総合成果:クラスタスループットの段階的向上
**Figure 21: 電力管理の各段階によるクラスタ総スループットの累積向上**
![[_attachments/arxiv-2605.24461/fig21-phase-throughput.png]]
(Figure 21. 1,200 W 定格基準に対して:
1. **計画時最適化 (1,200W $\to$ 960W)**: 配備可能 GPU 数の増加により **+10%** 向上
2. **配備後検証 (960W $\to$ 1,020W)**: テレメトリ較正により **+2%** 向上
3. **実行時制御 (Dimmer)**: 動的ヘッドルーム回収により **さらに +2%** 向上
合計で **+14% 超** の総計算スループット向上を達成した。)
---
## システム設計上の重要教訓
1. **「TDP 最大化」のパラドックス**:
- 単体チップのカタログ最高性能(最大 TDP)を追求することは、施設全体の受電容量が固定されたハイパースケール環境ではむしろ総スループットを毀損する。
2. **観測バイアスの罠**:
- PSU などの末端センサーは自己保護のため保守的な値を報告しがちである。高精度の系統測定(オシロスコープ/DCIM)との突き合わせを行わなければ、莫大な電力資産が死蔵される。
3. **同期学習と分散キャッピングの調和**:
- 同期型並列分散処理において、個々のノードが勝手にスロットリングを行うことは最悪のストラグラーを生む。電力制御はネットワークトポロジーとジョブ境界を認識した協調制御でなければならない。