# Warehouse-Scale Computer ## 定義 ウェアハウススケールコンピュータ(Warehouse-Scale Computer: WSC)とは、数千から数万台規模の計算ノード、直付けストレージ、クラスタネットワークファブリック、電力供給および冷却設備を含む建物全体のインフラストラクチャを、単一の巨大な計算ユニット(コンピュータ)として捉え、設計・運用される分散システムである。複数の無関係なサードパーティが独立した異種システムを持ち寄る従来型データセンターとは異なり、単一の組織が共通のシステムソフトウェア層と均質なハードウェアを用いて、少数の大規模インターネットサービス(検索、Webメール、クラウド基盤など)を実行することを前提とする。(Source: [[@2013__MorganClaypool__The Datacenter as a Computer - Chapter 1 Introduction]]) ## 未編纂の観察 - WSCではコンポーネント数が膨大であるため、個々のハードウェアの故障は例外的な事象ではなく常態(日常的運用の一部)として扱われる。そのため、高価なハードウェア的耐障害性(高信頼部品)に依存するのではなく、安価なコンポーネントを採用し、ソフトウェア層(分散ファイルシステムやクラスタ管理システム)による自動フェイルオーバーと複製によってサービスレベルの可用性を担保する設計が要求される。(Source: [[@2013__MorganClaypool__The Datacenter as a Computer - Chapter 1 Introduction]]) - メモリ・ストレージ・ネットワークの階層間に急峻なレイテンシ・帯域幅の不連続性(ラック内とラック間、DRAMとディスク/Flash)が存在し、クラスタファブリックのポート数増大に伴うコスト急増(バイセクション帯域10倍で約100倍のコスト)を避けるため、ネットワークはオーバーサブスクリプションを前提とした2層以上の階層構成が採用される。(Source: [[@2013__MorganClaypool__The Datacenter as a Computer - Chapter 1 Introduction]]) - 検索をはじめとするWebサービスでは、トラフィック増大、データ規模増大、アルゴリズム高度化に伴い計算需要が急増し続けるため、ハードウェア購入費用(CapEx)だけでなく電力や冷却施設などの運用費用(OpEx)を含めた包括的なコスト効率およびエネルギー効率が最重要の設計基準となる。(Source: [[@2013__MorganClaypool__The Datacenter as a Computer - Chapter 1 Introduction]]) - サーバー内の電力消費配分において、2000年代後半に問題となったメモリ電力の急増に対し、DDR3への移行や低電圧化、積極的な熱制御の導入により、サーバーピーク電力の最大要因が再びCPU(約59%)へと回帰している。(Source: [[@2013__MorganClaypool__The Datacenter as a Computer - Chapter 1 Introduction]]) - [コモディティハードウェア採用によるTCO構造の逆転] WSCにおいて安価なコモディティハードウェアを採用すると、従来のエンタープライズサーバ環境(ハードウェア関連費がTCOの78%)とは対照的に、施設減価償却(42%)と電力費(23%)を合わせた施設インフラ関連費が全体の65%を占め、サーバ自体の調達費用(35%)の2倍近くに達する逆転現象が生じる。サーバハードウェアのワットあたりコストが下落傾向にある一方で電気料金や施設建設費は上昇傾向にあるため、長期的に電力消費に連動する施設インフラコストがTCOを支配する。(Source: [[@2013__MorganClaypool__The Datacenter as a Computer - Chapter 6 Modeling Costs]]) - [規模の経済によるクラウド価格競争力と待機コスト] パブリッククラウドプロバイダが自社構築に対抗しうる低価格を提供できる原動力は規模の経済(固定運用費の按分と大量調達・自社設計による低Capex)にある。一方でオンデマンド料金が高価なのは突発的な需要変動に即応するための待機プール(稼働率約25%)の維持コストを反映しているためであり、3年契約等の長期コミットメントを活用することで自社運用と同等の費用効率が実現される。(Source: [[@2013__MorganClaypool__The Datacenter as a Computer - Chapter 6 Modeling Costs]]) ## 未解決の問い - クラスタ向け高帯域インターコネクトファブリックへの追加投資と、同等予算でのサーバー・ストレージノード増設のどちらが真にスループットとコスト効率の観点から優位であるかは、ワークロードの通信特性(オール・トゥ・オール通信の頻度等)に依存し、普遍的な最適解が存在しない。 - データセンター内部(イントラデータセンター)とデータセンター間(インターデータセンター)の通信帯域・遅延格差が将来的に大幅縮小した場合、WSCという単一計算ユニットの境界を複数データセンター群へと拡張すべきか否か。 - ハードウェア単体のTCOだけでなく、アプリケーションが生み出す実質的な価値(トランザクション数や検索クエリ数等)を反映したエンドツーエンドの費用対効果指標をいかに標準化・統合するか。 - ピーク時の過熱やブレーカートリップのリスクを回避しつつ、実環境で20〜50%に達する電力予備マージン(slack space/power)や死蔵容量(stranded capacity)をどこまで圧縮できるか。