# An Assessment of Beowulf-class Computing for NASA Requirements: Initial Findings from the First NASA Workshop on Beowulf-class Clustered Computing > [!abstract] 概要 > Beowulf 級の並列計算機は、NASA ゴダード宇宙飛行センターの宇宙データ情報科学卓越拠点(CESDIS)における小さな研究プロジェクトとして始まった。この研究から、大量市販の汎用部品(M2COTS)、自由に入手できるオペレーティングシステム、業界標準のソフトウェアパッケージで構成される、新しい種類のスケーラブルな計算機が生まれた。Beowulf 級システムは、価格性能比において並外れた利点をもたらす。Beowulf 級システムは、NASA の複数の研究センターで稼働して実際の仕事をこなしており、NASA が資金を出す学術研究を支え、DOE と NIH でも運用されている。NASA のユーザーコミュニティは、1997 年 10 月 22〜23 日にカリフォルニア州パサデナで、2 日間にわたる集中的なワークショップを開いた。Beowulf 級システムを扱うこの第 1 回ワークショップは、主に技術討論から成り、NASA の計算における機会・課題・現在の研究活動・方向性の範囲を定めることを目的とした。技術討論の範囲は、応用研究からプログラミング方法論にまで及んだ。本稿は、ワークショップの所見と結論を概観する。ワークショップは、Beowulf 級システムが前例のない価格性能比で数 Gflops の性能を出せる一方、特に大規模な「dreadnought」級のシステムではソフトウェア環境が十分に機能的でも堅牢でもないと判断した。NASA その他の機関の計算要件に Beowulf 級計算の可能性を十分に実現するため、Beowulf コミュニティは、必要なソフトウェア基盤の構成要素を、適切な箇所で統合・移植・開発する活動に取り組むことが勧告される。 ## 論文情報 - 著者: [[Thomas Sterling]](JPL)、[[Donald Becker]](GSFC CESDIS)、Michael Warren(Los Alamos National Laboratory)、Tom Cwik(JPL)、John Salmon(Caltech)、Bill Nitzberg(NASA Ames Research Center) - 媒体: 1998 IEEE Aerospace Conference Proceedings, vol. 4, pp. 367–381(1998 年 3 月)。PDF 本文に媒体名の印字はなく、書誌は IEEE Xplore の記録による。 - 位置づけ: 1997 年 10 月にパサデナで開かれた第 1 回 NASA Beowulf ワークショップ(NASA Ames 主催、JPL 開催)の所見の報告であり、実験論文ではなく技術評価の報告である。 ## 概要 M2COTS の PC を Linux と MPI で束ねた Beowulf 級クラスタは、適する応用では既存のベンダー製並列機の約 10 倍(不利な場合でも約 4 倍)の価格性能比を出す。小規模系は成熟しつつあるが、数百ノードの dreadnought 級はネットワーク(バイセクション帯域・レイテンシ・大域同期)とシステムソフトウェアが律速する。ワークショップは、ソフトウェア基盤の整備、スケーリング研究、レイテンシ耐性アルゴリズムを勧告した。 ## 問題設定 NASA は「より良く、より速く、より安く」の方針を採る。高性能計算は、高コスト、ベンダー数の減少、ベンダー間・世代間のアーキテクチャの多様性、不十分なソフトウェア環境のために利用しにくかった。この状況で、M2COTS の PC 技術を直接使う代替路が実用になるかを評価する。プロジェクトが立てた問いは次のとおりである。 - PC の山(pile of PCs)を実世界の応用に使えるか - 同等性能の既製品に対し、どの程度の価格性能比の利得が得られるか - PC クラスタを管理するソフトウェア環境に何が必要か - PC クラスタを数百ノードへスケールしてスーパーコンピュータ級の性能を出せるか - 分散共有メモリのプログラミングモデルを支えられるか ## 提案手法 新しい手法の提案ではなく、Beowulf 級システムの定義と評価枠組みの提示である。 - **定義**: ハードウェア・ソフトウェア・使い方の組み合わせ。PC のクラスタ(多くは Intel x86、DEC Alpha や PowerPC も可)で、部品は M2COTS に限る。例外はグローバルなネットワーク技術で、1 ポート当たりの費用に上限を置き、収まる製品だけを含める。 - **ソフトウェア**: ソース入手可能で無料か低価格の Unix 系 OS(Linux や BSD)、MPI・PVM などのメッセージパッシング。 - **利点**: 価格性能比、技術動向への素早い追随(ベンダー機は 2〜3 年前の技術を含みうるが、Beowulf は購入時点で数か月前の技術になりうる)、特定ベンダーへの非依存、構成をユーザーが設置時に決められる just-in-place の柔軟性。 - **系譜**: 1993 年後半に NASA HPCC の地球・宇宙科学プログラムとして GSFC で発足した。単一ユーザー向けのギガフロップス科学ワークステーションが要件で、当時ベンダーからは 50 万ドル未満では入手できなかった。ディスク容量と帯域がユーザー応答時間に効くという分析から、5 万ドル相当で 16 台の 80486(100 MHz)・各 32 MB メモリ・各 1.6 GB ディスク・10 Mbps Ethernet の構成が導かれた(ピーク約 1 gigaOPS)。 - **規模の区分**: 約 30 ノードで少数ユーザーの小規模系と、数百ノードで多数ユーザーの「dreadnought」級。 ## 新規性 本稿の貢献は、NASA コミュニティの合意としての評価にある。 - Beowulf 級クラスタの利点と限界を、複数の NASA センターの経験から整理した。 - システムエリアネットワーク(SAN)の費用対効果とスケーリング限界を、Fast Ethernet・Myrinet・高帯域バックプレーンのスイッチで比較した。 - システムソフトウェアの要件領域(応用開発・デバッグ/チューニング・低レベルインターフェース・OS サービス・アンサンブル管理・文書化)ごとに既存物と不足を表で整理した。 - 世代が混在するヘテロジニアスな構成が Beowulf 級の常態になるという見通しを述べた。 ## 実験設定 ワークショップで報告された複数の研究を引く。 - LANL: N 体重力ツリーコードを、16 プロセッサの Beowulf 級システム Loki(Fast Ethernet)と、同じ部品で通信網だけが異なる ASCI Red の 16 プロセッサ分で比較した。 - NASA Ames: NAS Parallel Benchmarks のうち SP・LU・BT で、数百ノードまでのネットワーク帯域とレイテンシの影響を調べた。 - GSFC: 10 Mbps Ethernet と 100 Mbps Fast Ethernet を、局所とノード間のファイルコピーで比較した。 - 1996 年 9 月に LANL と JPL/Caltech が設置した M2COTS システムによる、200 万粒子の N 体重力シミュレーション。 ## 実験結果 - **価格性能比**: 1996 年の 2 システムは約 5 万ドルで、持続 1.19 Gflops と 1.26 Gflops を達成した。SC'96 で Fast Ethernet の 16 本のポイントツーポイント線(100 Mbps)で接続すると、コードを再最適化せずに持続 2 Gflops 超となった。約 32 ドル/MFlops であり、当時のベンダー製品の約 10 倍にあたる。同等システムは 35,000 ドル未満に下がった。ベンダー側の値下げにより、差が 4 倍程度にとどまる場合もある。 - **PC の浮動小数点性能**: 直近 3 世代で PC は約 18 倍(結論部では約 20 倍)、ワークステーション用プロセッサは約 5 倍に向上した。 - **ネットワーク**: 目安として、ネットワーク費用は総システム費用の約 4 分の 1。1 ノードは通信を除いて 1,600〜1,800 ドルで、通信の予算は 1 ノード当たり 530〜600 ドルとなる。Fast Ethernet は NIC が約 50 ドル、アプリケーション間レイテンシが約 100 マイクロ秒(80 マイクロ秒未満も観測)で、16 プロセッサ以下では 1 ノード当たり約 225 ドルである。Myrinet は帯域が 1 Gbps 超、レイテンシが 20 マイクロ秒未満だが、NIC が 1 ポート約 1,400 ドルと高価で、費用の半分がネットワークに充てられうる。 - **スケール構成**: 16 ポートの Fast Ethernet スイッチを 2 段のツリーにすれば約 240 プロセッサまでは容易である。ただしルートのスイッチが全体のランダム通信のボトルネックになり、スパニングツリー経路制御のためスイッチを複数並べてバイセクション帯域を増やせない。Caltech CACR の 160 プロセッサ系は 80 ポートのバックプレーン 2 台を 1 Gbps の 4 チャネルで結び、1 プロセッサ当たり約 500 ドルである。 - **LANL の比較**: ASCI Red は Loki に比べて全体性能が 25〜30% 向上したにとどまる。 - **NAS ベンチマーク**: 約 100 マイクロ秒のレイテンシで、200 プロセッサ超でも理想に近い持続性能となった(遅延に鈍感になるよう作られたコードに限る)。100 ノードでの帯域(1 ノード当たり 8 MB/秒)による性能低下は、理想の無限帯域に比べて SP で約 15%、LU で 4%、BT で 8% である。300 ノードの SP では約 25% と推定される。 - **GSFC のファイルコピー**: 10 Mbps Ethernet は最悪で 80% の低下、Fast Ethernet は最悪で約 15% の低下だった。 - **障害**: ハードウェア障害の 95% は初期不良で、可能性の高い順にディスク、プロセッサのファン、電源、ネットワークカードである。その後の稼働時間は月単位で測られている。 - 本文が挙げる応用コードは表1(Table 1)にまとまる。 ![[wiki/sources/_attachments/An-Assessment-of-Beowulf-class-Computing-for-NASA-Requirements/table1-beowulf-codes.png]] 表1 は、Beowulf 級コンピュータ向けに開発された科学技術計算コードを組織別に示す。ARC は陰的 CFD・FFT・マルチグリッド NAS ベンチマーク、Caltech は天体物理 N 体ツリーコード・SPH・渦力学・反応性化学流、JPL は惑星の熱対流・海洋循環・電磁気コード、NIH は分子シミュレーション(CHARMM、AMBER)と量子化学(GAMESS)などである。 ## 考察 - **スケールする応用の特徴**: 並列 out-of-core 形式で書かれたもの、明示的な大域同期を要しないもの(例: 陽的時間刻みの格子 CFD は隣接間のペア通信でよい)、通信を 1 回の大規模通信(例: 大域転置)にまとめるもの。格子 CFD・画像処理・ツリー N 体コードはすでに適する。 - **レイテンシ**: Beowulf とスーパーコンピュータの最大の違いはレイテンシである。大域バリア同期が特に高くつくため、不要な同期を除くようにアプリケーションを組み替える必要がある。同期回数を減らせば帯域をレイテンシと引き換えられる可能性がある。 - **ネットワークトポロジー**: ハイパーキューブやトーラスなど、ノード経由通信によるトポロジーは大規模にできるが、バイセクション帯域が伸びず、遅延が増える。ネットワーク費用は規模に対して超線形に増え、クロススイッチの費用は O(n²) である。 - **ソフトウェア**: 環境の要件は小規模と dreadnought で大きく異なる。小規模系は収束しつつあるが、dreadnought は未解決である。共通ブート/インストール、システム監視、並列 rsh などが優先開発とされる。HPF は暗黙の同期のため Beowulf に向かないが、グローバルアドレス空間は魅力があるとされる。技術移転は、自由ソフトウェア方式が最良と合意された。 - **スケーラビリティ**: 単一 SMP ノードでは、4 プロセッサまでのマザーボードがあるものの、メモリ帯域が不足する。当時の Linux は SMP 内で同時に 1 つしか OS サービス呼び出しを実行できない。 - **ヘテロジニアス**: 3 世代で浮動小数点性能は約 20 倍に上がったが、ディスクアクセス速度は 3 倍未満にとどまる。世代混在とノード役割の分化により、コスト効果の高い系は不均一になる。これにはタスクスケジューリング・分散ファイル管理・細粒度のタスク分割などが要る。 - **今後(2 年)**: Gigabit Ethernet の価格低下、高帯域バックプレーン、SMP での OS サービス並列実行が可能な新 Linux、MPI-2、64 ビット PCI、メモリインタリーブが見込まれる。 - **共存**: 施設の計算資源は、Beowulf 級を含む複数種の混成になるだろう。 ## 強み / 弱点・課題 強み: - 複数のセンターと応用にまたがる実運用の経験に基づき、価格性能比の実測値と費用の内訳を数値で示す。 - スケールの障害(スパニングツリーによるバイセクション帯域の制約、Myrinet の費用比率)を具体的に指摘する。 - ソフトウェア基盤の不足を表で整理し、勧告に結び付ける。 弱点・課題: - ワークショップ報告であり、個々の数値の測定条件は本文中では十分に示されない。NAS ベンチマークの結果は遅延に鈍感になるよう作られたコードに限られると著者自身が断っている。 - 帯域の評価は、グローバルな帯域が 1 ポート当たり 100 Mbps を支えるという未検証の前提を置き、競合(コンテンション)を考慮していない。 - 価格性能比の差は、ベンダーの値下げで約 4 倍まで縮む場合がある。 - 書誌の媒体・年は PDF 本文に印字がなく、外部記録で補った。