# スーパーコンピュータ ## 定義 スーパーコンピュータは、同時代の汎用計算機を大きく上回る数値計算性能を、科学技術計算向けに提供する最高性能級の計算機である。1970 年代後半は、単一プロセッサのベクトル機が中心であり、米エネルギー研究開発局(ERDA)は「クラス VI」として毎秒 2,000 万〜6,000 万回の浮動小数点演算を要件に掲げた。1978 年の論文は、この要件を満たす唯一の計算機として [[CRAY-1]] を挙げる(Source: [[@1978__CACM__The CRAY-1 Computer System]])。 ## 未解決の問い - 「スーパーコンピュータ」の定義が、時代ごとの性能要件(クラス VI など)から、並列規模やエネルギー効率の指標へ移った経緯を、どの source が最も明確に示すか。 - 1964 年の CDC 6600(機能ユニットの並行動作と周辺プロセッサによる入出力の隔離)と 1978 年の CRAY-1(ベクトル機)は、性能向上の主因をどう分けているのか。 - 1 Pflop/s 級のヘテロジニアスなシステムでは、実効性能が LINPACK の持続速度ではなくアプリケーションの局所性の活用度で決まるという論点は、他の世代のスーパーコンピュータでも確認できるか。 - 「京」の解説が挙げるスケーラビリティ阻害要因(通信時間、IO、処理遅延と不均衡、OS ジッタ)は、BG/L や Roadrunner など他世代の機でどう扱われ、どの要素で設計が分かれたか。 - ヘテロジニアス機でのノードあたりの CPU 対 GPU 比(Aurora の 2:6、Perlmutter の 1:4 など)は、何を制約として決まっているのか。 - Titan の 2 区画換装のように本番機を止めずに更新する運用は、京や Blue Gene/L など他世代の機でどう扱われたか。 - ヘテロジニアス機の HBM 対 DDR の帯域比(Titan 40 倍、Summit 16 倍、Frontier 64 倍)は、ノードあたりの CPU 対 GPU 比と同じく何が上限を決めているのか。コストの 30% 超をメモリが占める点との関係はどうか。 - Fugaku の Green500 首位(プロトタイプ機、16.87 GFLOPS/W)と、同論文が KPI の節で述べる「GPU に近い」電力効率は、どの構成・時点の比較で、GPU 世代機(Perlmutter や El Capitan など)とどう並べて読めるか。 ## 未編纂の観察 - [[@1978__CACM__The CRAY-1 Computer System]] は、CRAY-1 の主記憶帯域(80 百万語/秒)が性能の足かせになる点を、大容量レジスタで補う設計を採ったと述べる。メモリ帯域を演算性能と釣り合わせる課題は、初期のスーパーコンピュータから存在した。 - [定義] 1960 年に着手した CDC 6600 は、回路性能の力ずくの向上と並列動作の 2 つを高度な計算機の主な道とみなし、演算専用の中央プロセッサを入出力・制御の処理(10 台の周辺・制御プロセッサ)から中央メモリだけで隔離した。中央メモリは 32 バンクで、アドレスを 100 ns ごとに発行でき、典型の転送率は毎秒約 2 億 5000 万ビットである。同じ論点の後年の記述は [[@1978__CACM__The CRAY-1 Computer System]] にある(Source: [[@1964__AFIPS FJCC__Parallel Operation in the Control Data 6600]]) - [定義] 1978 年の CRAY-1 論文が ERDA のクラス VI という浮動小数点演算の性能要件で最高性能級を定義したのに対し、2005 年の Blue Gene/L 論文は、ラック性能を性能/ワット × ワット/ラックで捉え、電力・パッケージング・拡張性・RAS を設計の主課題に据える。定義の軸が単一プロセッサの絶対性能から、並列規模と電力効率へ移った例として読める。ただしこの対比は 2 本の設計記述を並べた読みで、移行の過程を示す source ではない(Source: [[@2005__IBM JRD__Overview of the Blue Gene/L system architecture]], [[@1978__CACM__The CRAY-1 Computer System]]) - [定義] [[@1978__CACM__The CRAY-1 Computer System]] がメモリ帯域を演算性能と釣り合わせる課題を大容量レジスタで補ったのに対し、[[Roadrunner]] は演算の約 95% を担うアクセラレータの SPE に 256 KB のローカルストアだけを直接アドレスさせ、主記憶へは明示的な DMA で転送させる。1 Pflop/s 級では、同じ帯域の課題が『局所性の階層を使い切ること』の要求として利用者に移っている(Source: [[@2008__SC__Entering the Petaflop Era - The Architecture and Performance of Roadrunner]], [[@1978__CACM__The CRAY-1 Computer System]]) - [[@1999__Parallel Computing__Development of supercomputers in Japan - Hardware and software]] は、日本のスーパーコンピュータがメインフレームの延長として作られ、第 1 世代ではメインフレーム技術がスーパーコンピュータへ移り、第 2 世代では VP2000 と SX-3 の技術がメインフレーム(M-1800、ACOS-3800)へ移ったとする。開発費を数百台のメインフレームで償却でき、3 社が世界有数の半導体供給者であることも競争力の源だった。非専門家向けの自動ベクトル化と単体での高性能を重視する設計は、専門家向けの Cray と対照的だったとされる(Source: [[@1999__Parallel Computing__Development of supercomputers in Japan - Hardware and software]] §3.4、§4.4、§8)。 - [クラスタ型の対抗軸] 1990 年代後半、専用ハードウェアの MPP に対し、市販 PC を束ねた Beowulf 級クラスタが約 5 万ドルで持続 1.2 Gflops 級を出し、適する応用でベンダー機の約 4〜10 倍の価格性能比を示した。律速は数百ノードでのネットワークとソフトウェア環境である(Source: [[@1998__IEEE Aerospace__An Assessment of Beowulf-class Computing for NASA Requirements]]) - [定義] 1992 年の CM-5 は、1 テラフロップス級を設計目標に掲げ、最大 16,384 ノード(約 30 m 四方)へ拡張でき、論理設計は 100 万ノードまで拡張できると述べる。単一プロセッサのベクトル機([[CRAY-1]])に対し、標準のマイクロプロセッサ(SPARC)と自前のベクトルユニットを持つ多数のノードを、専用の 3 網で束ねる方向の記述である。時分割と空間分割の併存、故障を前提にした可用性、利用者保護を、性能と並べて設計目標に挙げる点も特徴である(Source: [[@1992__SPAA__The Network Architecture of the Connection Machine CM-5]]) - [定義] 2007 年に「京」の開発を始めた時点の Top500 第 1 位はリンパック 280 テラフロップスで、ハイエンドは PC クラスタから専用のプロセッサ・インターコネクトによる超並列へ移り始めていた。米国では 1 ペタフロップスの実アプリケーション性能を目標とし 100 万コア級を前提とする次世代機の開発が複数進んでおり、「京」は 10 ペタフロップスの実行性能に向け 128 ギガフロップスの 8 コアプロセッサを 8 万個以上結合した。著者は 2018〜2020 年のエクサスケール時代を 1 億コア級と見込み、さらなる技術革新が要ると述べる(Source: [[@2011__応用物理__次世代スパコン「京」のコアテクノロジ]] §1、§2、§4) - 2020 年代の HPE Cray EX 系機は、キャビネット単位のスイッチブレードとドラゴンフライトポロジで結ばれる。Perlmutter はピーク FP64 が GPU パーティション 69.5 PFLOPS と CPU パーティション 15.4 PFLOPS で、El Capitan は 46,080 基の APU で倍精度 2,889.2 PFLOP/s、ピーク電力 36.0 MW である(Source: [[@2026__NERSC__Perlmutter Architecture]], [[@2026__LLNL HPC__El Capitan Hardware Overview]]) - Aurora は Xeon Max 2 基と PVC 6 基のノード比 2:6 を、電力・寸法の制約内で性能と密度を最大にする値として選び、単一ノード HPL で 145 TF/s(通常負荷 3.8 kW)を出す。CPU に HBM と、GPU・NIC 間の PCIe を捌く極多コア構成(XCC)を選んだ点は、ヘテロジニアス機で CPU の役割をデータ移動の中継と前処理に置いた設計判断である(Source: [[@2025__arXiv__Aurora - Architecting Argonne's First Exascale Supercomputer for Accelerated Scientific Discovery]]) - Aurora は 175 グループの 1 次元ドラゴンフライで、166 の計算グループが各 1 キャビネットに対応する。Perlmutter・El Capitan と同じ Slingshot 系の構成で、注入帯域 2.12 PB/s、全体バイセクション帯域 0.69 PB/s を持つ(Source: [[@2025__arXiv__Aurora - Architecting Argonne's First Exascale Supercomputer for Accelerated Scientific Discovery]]) - 稼働中のペタスケール機を止めずに世代交代する運用が設計の前提になる。Jaguar から Titan への換装は、外部ファイルシステム Spider を共有したまま 104 と 96 キャビネットの 2 区画に分け、X 次元ケーブルを外して片側ずつ換装し、利用者が計算できない期間を最終受け入れ試験の数日に限った。SeaStar と Gemini が電気的に非互換でも同じ筐体・ケーブル・バックプレーンを使えた設計が、この運用を可能にした(Source: [[@2012__CUG__Titan - Early experience with the Cray XK6 at Oak Ridge National Laboratory]]) - [インターコネクトの世代交代] Gemini は 1 個の ASIC で 2 ノードを収容してトーラスの Y 方向の頂点を半減させた(Jaguar の 25×32×24 から Titan の 25×16×24)。XT5 に対して MPI 単方向帯域が約 2〜4 倍、隣接ノードのゼロバイト遅延が 6.20 μs から 1.5〜1.7 μs へ、全系の All Reduce が 147 μs から 22.41 μs へ縮んだ(Source: [[@2012__CUG__Titan - Early experience with the Cray XK6 at Oak Ridge National Laboratory]]) - [定義] Frontier は 2008 年の DARPA 報告の 4 課題のうち、エネルギー(1.1 EF を 21.1 MW、52 GF/W)、メモリ・ストレージ、並行性・局所性を満たし、レジリエンスだけが投影した 4 時間目標と同程度に留まった。成功基準は報告書の資源 1,000 倍ではなく実アプリの高速化(CAAR は Summit 比 4 倍、ECP は約 20 PF 機比 50 倍)に置き直され、報告された全アプリが達成した(Source: [[@2023__SC__Frontier - Exploring Exascale]]) - [ヘテロジニアス比] Frontier のノードは CPU 対 GPU が 1 対 4(MI250X は 2 GCD で OS から 8 GPU に見える)で、Titan の 1 対 1、Summit の 1 対 3、Aurora の 2 対 6 と並ぶ。ノードの HBM 総帯域は CPU メモリの 64 倍で、Titan 40 倍・Summit 16 倍より偏りが大きく、データを HBM に置き続ける前提の設計になった。NIC は 4 枚を MI250X に直結する(Source: [[@2023__SC__Frontier - Exploring Exascale]]) - Fugaku は電力予算(施設の給電 30〜40 MW)と実アプリケーション性能を KPI に置き、L3 なし・DDR なしの単一大型ダイ(48+4 コア、HBM2 32 GiB、1024 GB/s)の A64FX を 158,976 ノード並べ、理論ピーク 537 PF・HPL 442 PF に達した。運用電力は平均約 20 MW、最大 30 MW 近い。ピークに対する HPL の比は約 82% である(算術による確認)。前世代の「京」がスケーラビリティ阻害要因(通信・IO・OS ジッタ)を設計軸にしたのに対し、Fugaku は電力とメモリ帯域を軸に、Tofu の 6 次元トーラスは互換性のため継承した(Source: [[@2022__IEEE Micro__Co-Design and System for the Supercomputer Fugaku]]、[[@2011__応用物理__次世代スパコン「京」のコアテクノロジ]]) ## 関連 - ソース: [[@1978__CACM__The CRAY-1 Computer System]] / [[@1964__AFIPS FJCC__Parallel Operation in the Control Data 6600]] / [[@2005__IBM JRD__Overview of the Blue Gene/L system architecture]] / [[@2008__SC__Entering the Petaflop Era - The Architecture and Performance of Roadrunner]] / [[@1999__Parallel Computing__Development of supercomputers in Japan - Hardware and software]] / [[@1998__IEEE Aerospace__An Assessment of Beowulf-class Computing for NASA Requirements]] / [[@1992__SPAA__The Network Architecture of the Connection Machine CM-5]] / [[@2011__応用物理__次世代スパコン「京」のコアテクノロジ]] / [[@2026__NERSC__Perlmutter Architecture]] / [[@2026__LLNL HPC__El Capitan Hardware Overview]] / [[@2025__arXiv__Aurora - Architecting Argonne's First Exascale Supercomputer for Accelerated Scientific Discovery]] / [[@2012__CUG__Titan - Early experience with the Cray XK6 at Oak Ridge National Laboratory]] / [[@2023__SC__Frontier - Exploring Exascale]] / [[@2022__IEEE Micro__Co-Design and System for the Supercomputer Fugaku]] - 概念: [[ベクトルプロセッサ]] / [[メモリウォール]] / [[スコアボード]] / [[強スケーリングと弱スケーリング]] / [[ヘテロジニアスコンピューティング]] / [[自動ベクトル化]] / [[クラスタコンピューティング]] / [[協調設計]] - エンティティ: [[CRAY-1]] / [[Cray Research]] / [[CDC 6600]] / [[Control Data Corporation]] / [[IBM Blue Gene/L]] / [[Roadrunner]] / [[Fujitsu]] / [[Hitachi]] / [[NEC Corporation]] / [[Connection Machine CM-5]] / [[K computer]] / [[Titan]] / [[Jaguar]] / [[Cray Gemini]] ## 出典 - [[@1978__CACM__The CRAY-1 Computer System]] - [[@1964__AFIPS FJCC__Parallel Operation in the Control Data 6600]](6600 の設計思想と構成) - [[@2005__IBM JRD__Overview of the Blue Gene/L system architecture]](BG/L が挙げる設計課題と 2005 年時点の設計点) - [[@2008__SC__Entering the Petaflop Era - The Architecture and Performance of Roadrunner]](1 Pflop/s を初めて超えた Roadrunner の構成と性能) - [[@1999__Parallel Computing__Development of supercomputers in Japan - Hardware and software]](日本の商用スーパーコンピュータの通史) - [[@1992__SPAA__The Network Architecture of the Connection Machine CM-5]](1 テラフロップス級の超並列機 CM-5 の設計目標と構成) - [[@2011__応用物理__次世代スパコン「京」のコアテクノロジ]](「京」の目標、構成、スケーラビリティ課題) - [[@2026__NERSC__Perlmutter Architecture]](Perlmutter の構成と性能) - [[@2026__LLNL HPC__El Capitan Hardware Overview]](El Capitan の構成と性能) - [[@2025__arXiv__Aurora - Architecting Argonne's First Exascale Supercomputer for Accelerated Scientific Discovery]](Aurora のノード・ネットワーク設計) - [[@2023__SC__Frontier - Exploring Exascale]](Frontier の設計と DARPA 報告との照合)