# Power Provisioning for a Warehouse-sized Computer > [!abstract] 概要 > 大規模インターネットサービスには、倉庫規模の計算システムと適切に表現できる計算インフラストラクチャが必要である。所定の電力容量をこのようなコンピュータへ供給できるデータセンター設備の建設費は、継続的なエネルギー消費費用そのものに匹敵し得る。したがって、一回限りの設備費を最もよく償却するには、設備を可能な限り最大容量に近い状態で運用する強い経済的動機がある。 > > しかし、機器の定格電力には不確実性があり、消費電力は実際の計算活動によって大きく変動するため、実際にはそれを達成しにくい。所定の電力予算の中にどれだけの計算機器を安全かつ効率的に配置できるかを決めるには、有効な電力プロビジョニング戦略が必要である。 > > 本論文は、約6か月にわたり異なる種類のアプリケーションを実行する最大1万5千台のサーバ群について、集約電力使用の特性を示す。これらの観察により、データセンターに導入済みの電力容量の利用を最大化する機会を評価し、その容量を過剰に契約・配備するリスクを評価できる。 > > 適切に調整されたアプリケーションでも、クラスタ水準(数千台のサーバ)では実現した集約ピーク電力と理論上の集約ピーク電力の間に7〜16%の顕著な差があることを見いだした。差はデータセンター全体ではほぼ40%まで大きくなる。この余裕は、同じ電力予算の中で上限を超える危険を最小限にしながら追加の計算機器を導入するために使える。本論文のモデリング枠組みにより、電力管理方式がピーク電力とエネルギー使用量を減らす可能性を見積もる。 > > 電力およびエネルギー節減の機会は大きいが、ラック水準(数十台)よりもクラスタ水準(数千台)で大きいことを見いだした。最後に、システムはピーク性能時だけでなく、活動度の全範囲で電力効率を持つ必要があると論じる。 ## 論文情報 - **タイトル**: Power Provisioning for a Warehouse-sized Computer - **著者**: [[Xiaobo Fan]], [[Wolf-Dietrich Weber]], [[Luiz André Barroso]] - **所属**: [[Google]] Inc. - **媒体**: ISCA 2007 (34th International Symposium on Computer Architecture), pp. 13–23 - **対象規模**: 約6ヶ月間、最大15,000台の商用サーバ(Google 本番クラスタ:Web検索、GMail、MapReduce、混在データセンター) --- ## 概要 倉庫規模コンピュータ(WSC: Warehouse-Scale Computer)における**電力プロビジョニングとオーバーサブスクリプション(Power Oversubscription)の基礎理論を確立した歴史的名著**。 データセンターの建設費用(CapEx)は受電可能なピーク電力容量(MW)に直接比例するが、従来のインフラ設計は機器のカタログ値(銘板電力: Nameplate Power)に依存しており、莫大な電力マージンが未利用のまま死蔵されていた。Google の実運用環境における 15,000 台規模・6ヶ月間の電力・CPU テレメトリを精緻に分析し、**「ラック単位(数十台)のオーバーサブスクリプションは同時ピークにより遮断器(ブレーカー)を落とす危険があるが、クラスタ単位(数千台)やデータセンター全体では統計的平滑化(ダイバーシティ効果)により 17%〜40% 近い追加マシンを安全に収容できる」** ことを実証した。さらに、現行サーバのアイドル電力がピークの 50〜60% に達している非効率性を白日の下に晒し、同年冬の Barroso & Hölzle による『エネルギー比例コンピューティング』への直接の導火線となった。 --- ## データセンター電力分配の階層構造とプロビジョニング問題 ### 1. 電力供給階層 (Power Distribution Hierarchy) データセンターの電力供給は、上位から下位へと階層的に分岐するツリー構造を持つ。 **Figure 1: データセンター電力供給階層の模式図** ![[_attachments/power-provisioning-warehouse-sized-computer/fig01-power-distribution.png]] (Figure 1. 商用電源(Utility Substation)から受電した電力は、UPS を経て PDU(Power Distribution Unit: 75〜200 kW、数百台収容)へ送られ、分岐回路(Branch Circuits: 110V/20A または 230V/16A、約 2.5 kW)を通じて各ラック(約 40 台)へ供給される。) 上位の設備ほど高価であり、変圧器・UPS・PDU・発電機などの受電設備容量(CapEx)を 100% 近く使い切ることがデータセンター TCO の劇的な低減につながる。しかし、どの階層であれ定格電流を超過すれば遮断器(Circuit Breaker)がトリップして大規模なサービス停止を引き起こす。 ### 2. 銘板電力と実測電力の巨大なギャップ ハードウェア調達時にメーカーが提供する「銘板電力(Nameplate Power)」は、各部品の理論最大消費電力を単純合算した極端に保守的な値である。 **Table 1: 典型的な Google サーバのコンポーネント別ピーク電力内訳** | 構成要素 | 単体ピーク電力 (W) | 搭載数 | 合計ピーク (W) | |:---|---:|:---:|---:| | CPU (x86 プロセッサ) | 40 W | 2 | 80 W | | メモリ (DRAM DIMM) | 9 W | 4 | 36 W | | ハードディスク (3.5" HDD) | 12 W | 1 | 12 W | | PCI 拡張スロット | 25 W | 2 | 50 W | | マザーボード | 25 W | 1 | 25 W | | ファン | 10 W | 1 | 10 W | | **システム純消費電力合計** | | | **213 W** | | **電源変換効率 85% 考慮後の銘板電力** | | | **251 W** | | **過酷なストレステスト時の実測最大電力** | | | **145 W** | | **実運用時の最高観測ピーク電力 (Web検索)** | | | **~135 W** | 電源の最大効率(85%)を考慮した銘板電力は **251 W** であるのに対し、ストレステストベンチマークでの実測最大電力は **145 W**(銘板の 58%)、実運用のピークでは **135 W** に過ぎない。銘板電力で PDU や配電盤をプロビジョニングすると、設備の 40% 以上が永久に使われないまま遊休化する。 --- ## 測定アーキテクチャと電力モデリング ### 1. CPU 利用率ベースの非線形電力モデル 全サーバに物理電力計を取り付けることはコスト・信頼性の面で非現実的であるため、CPU 利用率 $u \in [0, 1]$ から全システム消費電力を高精度に推定する経験的非線形モデルを開発した: $P(u) = P_{\text{idle}} + (P_{\max} - P_{\text{idle}}) \left( 2u - u^r \right)$ ここで $P_{\text{idle}}$ はアイドル時電力、$P_{\max}$ はベンチマーク最大電力、$r$ は実測データへのフィッティングパラメータである($r \approx 1.2〜1.5$)。 **Figure 2 & 3: マシン単位の電力モデル適合度と PDU 単位での実測検証** ![[_attachments/power-provisioning-warehouse-sized-computer/fig02-machine-power-model.png]] ![[_attachments/power-provisioning-warehouse-sized-computer/fig03-pdu-model-validation.png]] (Figure 2. 単純な線形モデル $P(u) = P_{\text{idle}} + (P_{\max}-P_{\text{idle}})u$ に比べ、提案の非線形モデルは実測曲線に極めて忠実に一致する。Figure 3. 数百台を収容する PDU における実測電力とモデル推定値の比較。固定の系統誤差(ベースロード)を差し引くと、全利用率範囲にわたり推定誤差は 1% 未満に収まる。) ### 2. MapReduce ベースの分散収集・分析パイプライン **Figure 4: テレメトリ収集・保存・分析アーキテクチャ** ![[_attachments/power-provisioning-warehouse-sized-computer/fig04-collection-architecture.png]] (Figure 4. 各サーバ上の軽量デーモンが 1 秒ごとに CPU 活動度をサンプリングし、10 分平均値を収集クラスタへ転送。中央ストレージに蓄積されたペタバイト級のログを、MapReduce ジョブによってハードウェア種別ごとの電力モデルと結合し、ラック・PDU・クラスタ・データセンターの各階層における電力時系列を合成する。) --- ## ワークロード別の電力累積分布 (CDF) と集約効果 5,000台規模のクラスタにおいて、実測可能最大電力の合計($\sum P_{\max}$)を 100% として正規化した電力累積分布(CDF)を測定した。 ### 1. 単一ワークロードクラスタ(Web検索、GMail、MapReduce) **Figure 5, 6, 7: 各ワークロードのラック vs クラスタ電力 CDF** ![[_attachments/power-provisioning-warehouse-sized-computer/fig05-websearch-power-cdf.png]] ![[_attachments/power-provisioning-warehouse-sized-computer/fig06-webmail-power-cdf.png]] ![[_attachments/power-provisioning-warehouse-sized-computer/fig07-mapreduce-power-cdf.png]] - **Web検索 (Figure 5)**: - ユーザークエリのトラフィック変動が直接負荷に反映される。ラック(40台)レベルでは、局所的なクエリ集中によって最大 **98%** の電力に達する。 - しかしクラスタ全体(5,000台)に集約すると、観測ピークは **93.5%** を超えない。 - **GMail (Figure 6)**: - ディスク I/O 集約型サービス。ディスクの電力変動幅が CPU よりはるかに小さいため、動的電力範囲が狭い。 - ラック最大は 92%、クラスタ最大は **86.5%**。 - **MapReduce (Figure 7)**: - バッチ処理。個々のラックはシャッフルやリデュース処理で 95% 近くまで跳ね上がるが、ジョブ進行の非同期性によりクラスタ最大は **90.1%** に抑えられる。 ### 2. 異種ワークロード混在と実データセンターの集約効果 **Figure 8 & 9: 混在ワークロードおよび実稼働データセンター全体の電力 CDF** ![[_attachments/power-provisioning-warehouse-sized-computer/fig08-workload-mix-cdf.png]] ![[_attachments/power-provisioning-warehouse-sized-computer/fig09-real-datacenter-cdf.png]] - **混在クラスタ (Figure 8)**: Web検索・GMail・MapReduce を同一クラスタ内に分散配置すると、ピーク発生のタイミングの統計的多様性(Diversity)が働き、クラスタ観測ピークは **85.4%** にまで低下する。 - **実データセンター全体 (Figure 9)**: 複数サービスが混在する実際のデータセンター全体では、電力範囲は 52%〜72% の狭い帯域に収束し、観測された最大電力は理論実測ピークのわずか **71.9%** に過ぎない。 **Table 3: クラスタ水準における平均電力と観測ピーク電力 (実測ピークに対する正規化比率)** | ワークロード | 平均電力 | 観測ピーク電力 | 平均 / 観測ピーク比率 | |:---|---:|---:|---:| | Web検索 | 68.0% | 93.5% | 72.7% | | GMail | 77.8% | 86.5% | 89.9% | | MapReduce | 69.6% | 90.1% | 77.2% | | **混在クラスタ** | 72.1% | **85.4%** | 84.4% | | **実データセンター** | 59.5% | **71.9%** | 82.8% | --- ## パワーオーバーサブスクリプションとキャッピングの定量的効果 観測ピークが実測最大合計を下回るということは、**「同じ電力インフラ設備の中に、より多くのサーバを安全に追加配置(オーバーサブスクライブ)できる」** ことを意味する。 ### 1. 安全弁としてのパワーキャッピング (Power Capping) もし稀に全サーバが同時に最大負荷に達した場合に備え、CPU クロック引き下げ(DVFS)やリクエストスロットリングを行う「パワーキャッピング機構」を導入する。年間稼働時間のうちキャッピングが発動する割合(0%, 1%, 2%)を許容することで、追加配備可能台数が劇的に増加する。 **Table 2: パワーキャッピング許容時間と追加配備可能サーバ台数・発動頻度** | ワークロード | 上限制御時間許容 | **追加配備可能台数** | 月あたり発動回数 | 継続時間中央値 | 継続時間平均 | |:---|---:|---:|---:|---:|---:| | **Web検索** | 0% (完全安全) | **+7.0%** | — | — | — | | **GMail** | 0% | **+15.6%** | — | — | — | | **MapReduce** | 0% | **+11.0%** | — | — | — | | | 1% 許容 | **+21.5%** | 21.0 回 | 10.0 分 | 20.5 分 | | | 2% 許容 | **+23.8%** | 38.8 回 | 20.0 分 | 22.2 分 | | **混在クラスタ** | 0% | **+17.1%** | — | — | — | | | 1% 許容 | **+21.7%** | 12.2 回 | 20.0 分 | 35.3 分 | | | 2% 許容 | **+23.5%** | 23.1 回 | 20.0 分 | 37.3 分 | | **実データセンター** | **0% (完全安全)** | **+39.1%** | — | — | — | | | **1% 許容** | **+44.7%** | 9.0 回 | 20.0 分 | 47.9 分 | | | **2% 許容** | **+46.0%** | 12.5 回 | 40.0 分 | 69.3 分 | 実データセンターにおいて、キャッピングを一切使わない完全安全運用でも **+39.1%**、年間わずか 1%(月 9 回、平均 48 分間)のスロットリングを許容するだけで **+44.7%**、2% 許容で **+46.0%** のサーバを追加収容できる。 --- ## 動的電圧スケーリング (DVS) の限界とアイドル電力問題 ### 1. DVS(動的周波数・電圧制御)の限界 CPU 利用率が一定閾値を下回った際に CPU 電力を半減させるオラクル DVS ポリシーをシミュレーションした。 **Figure 10: クラスタにおける CPU DVS のピーク削減効果 vs エネルギー削減効果** ![[_attachments/power-provisioning-warehouse-sized-computer/fig10-dvs-peak-power.png]] ![[_attachments/power-provisioning-warehouse-sized-computer/fig10-dvs-energy-saving.png]] (Figure 10. DVS は累積エネルギー消費の削減には寄与するが、Web検索などのピーク電力削減にはわずか 1〜2% しか寄与しない。データセンターのインフラ設備容量はピーク電力で決定されるため、DVS 単体ではプロビジョニング容量の拡大にはほとんど貢献しない。) ### 2. アイドル電力の高さという構造的病理 **Figure 11: Google の歴代 5 世代サーバにおけるアイドル電力比率** ![[_attachments/power-provisioning-warehouse-sized-computer/fig11-idle-power-ratio.png]] (Figure 11. 2000 年代初頭から 2007 年に至る 5 世代のサーバすべてにおいて、何も仕事をしていないアイドル時の消費電力が、実測ピークの **50%〜60%** に達している。) ### 3. 「アイドル電力 10%」がもたらす破壊的インパクト もしサーバが無負荷時にピークの 10% の電力しか消費しない「エネルギー比例マシン」が実現した場合のシミュレーションを実施した。 **Figure 12: アイドル電力 10% 達成時のピーク電力および総エネルギー削減効果** ![[_attachments/power-provisioning-warehouse-sized-computer/fig12-idle-power-savings.png]] (Figure 12. アイドル電力をピークの 10% に低減できれば、実データセンターの観測ピーク電力は **30% 以上急減** し、年間総エネルギー消費量は **半分未満(50%超削減)** に激減する。) --- ## 本研究の歴史的意義とシステム設計への教訓 1. **集約粒度の黄金律(ラックでやるな、クラスタでやれ)**: - ラック単位(40台)でのオーバーサブスクリプションは、同一ラック内のノードが同一ジョブで同時にスパイクした際に分岐回路ブレーカーを遮断する致命的リスクを孕む。しかし、PDU やデータセンター全体という巨大な母集団に集約することで、大数の法則とワークロード多様性による強固な安全マージンが生まれる。 2. **インフラの経済学(CapEx vs OpEx)の変革**: - データセンターの生涯コストにおいて、受電設備・空調インフラの固定資産償却費は電気代そのものと同等以上に重い。ピーク電力マージンを詰めて収容密度を 40% 高めることは、データセンター建設コストを数億ドル規模で削減することを意味する。 3. **『エネルギー比例コンピューティング』の誕生へ**: - 本論文の結論部(Figure 11, 12)で提示された「現行ハードウェアのアイドル電力が高すぎる」という強烈な問題意識は、筆頭著者の一人 Luiz André Barroso 自身によって深掘りされ、同年(2007年12月)の IEEE Computer 誌における歴史的論文 [[@2007__Computer__The Case for Energy-Proportional Computing]] の執筆へと直結した。