# エクサスケール
## 定義
エクサスケール(Exascale Computing)とは、毎秒$10^{18}$回(100京回、1 ExaFLOPS)以上の浮動小数点演算を実行可能な超大規模計算機システムおよびその計算パラダイムである。米国Exascale Computing Project(2024年完結)をはじめとする世界的プロジェクトにより実現されたが、従来のフォン・ノイマン型CPU/GPUクラスタでは、メモリウォールとネットワーク通信遅延により、複雑な物理シミュレーションの実効性能がピーク性能の極めて小さな割合に留まるという課題に直面している。(Source: [[@2026__HPCAsia__Beyond Exascale - Dataflow Domain Translation on a Cerebras Cluster]])
## フォン・ノイマン型エクサスケールクラスタの壁
- **ステンシル計算における極度の実効利用率低迷**: 偏微分方程式の空間差分(ステンシル計算)や地球システムモデルでは、演算密度(FLOP/Byte)の低さとメモリウォールにより、ペタ・エクサスケール機であっても大半のモデルが1.2〜8 PFLOP/s(ピーク比5%未満、最大でも25.96 PFLOP/s)しか達成できていない。
- **時間領域における強スケーリングの停滞**: 弱スケーリング(Weak Scaling)により空間格子数や解像度を拡大することは可能であるが、ノード間ネットワーク遅延($\tau$)が各時間ステップの同期に介在するため、時間積分ステップの進行速度(強スケーリング)は頭打ちとなり、長期間の気候変動予測や実時間物理シミュレーションの重大な制約となっている。
- **ゴーストセル(領域分割)手法の原理的限界**: 従来の領域分割法において遅延を隠蔽するためにゴースト領域を厚くする(オーバーラップ手法)と、余剰な再計算量が増大し、利用率が$(\tau f)^d$の多項式で急激に劣化するトレードオフが存在する。
## エクサスケールを超えるデータフロー的アプローチ
- **空間データフローによる強スケーリングの突破**: 空間アーキテクチャ(WSEなど)と領域平行移動アルゴリズムにより、ノード間通信遅延を完全に計算とオーバーラップさせ、毎秒160万タイムステップ超の時間発展速度とピーク比88%の超高利用率を達成できる。
- **広域分散ネットワークによるエクサスケール連携の可能性**: メモリ量に対して2乗で遅延隠蔽能力が拡大する($n^2 > 2p\tau/c$)特性を活用することで、ミリ秒単位の広域ネットワーク(WAN)を介して異なる都市のエクサスケールマシン群を単一のシミュレーションファブリックとして連携させる展望が開かれている。
## 未解決の問い
- エクサスケール級の超大規模クラスタにおいて、従来の単精度・倍精度浮動小数点演算の数値安定性と、省電力アーキテクチャにおけるエネルギー効率(50 GFLOP/J超)の最適バランスはどのように導出されるか。
- 地球システムモデル(E3SM, CESMなど)において、大気・海洋・陸面結合の多物理モデル全体をデータフロー型エクサスケールシステムへ移植する際、どのような通信・同期抽象化が必要となるか。
- Aurora の HPL(倍精度 1.012 EF/s)と HPL-MxP(混合精度 11.64 EF/s)の差は、ステンシルなどメモリバウンドなアプリケーションの実効性能にどこまで当てはまるか。
- エクサスケールの成功基準を HPL の EF ではなく実アプリの高速化で測る方式は、ベースライン機がアプリごとに違う(Titan、Cori、Mira、Theta、Summit)ことを補正できているか。
- 「エクサスケール」を倍精度 HPL、混合精度 HPL-AI、理論ピークのどれで定義するかで、Fugaku・Aurora・El Capitan の位置づけはどう変わるか。
- 2008 年の 4 課題(電力・メモリ・並行性・レジリエンシ)のうち、Frontier や Aurora の実機で実際に解けたものと、緩和にとどまるものはどれか。
## 未編纂の観察
- **64台のCS-3クラスタがエクサスケール級の電力効率(57 GFLOP/J)と112 PFLOPSのステンシル性能を実証**: 従来のフォン・ノイマン型スーパーコンピュータ(Green500首位JEDIの密行列72.7 GFLOP/Wなど)に匹敵・凌駕する効率を、メモリバウンドな疎ステンシル計算において達成し、エクサスケール計算の新たなパラダイムを示した。(Source: [[@2026__HPCAsia__Beyond Exascale - Dataflow Domain Translation on a Cerebras Cluster]])
- [定義] Aurora(10,624 ノード・63,744 GPU)は、標準ベンチマークで HPL 1.012 EF/s(SC24 で 3 位、効率 78.84%)、低精度の HPL-MxP 11.64 EF/s(同 1 位)を記録した。倍精度の持続性能と低精度の性能には約 11 倍の開きがある。単一 GPU の GEMM は FP64 が 29.2 TF/s、INT8 が 854.3 TF/s である(Source: [[@2025__arXiv__Aurora - Architecting Argonne's First Exascale Supercomputer for Accelerated Scientific Discovery]])
- [エクサスケールを超えるデータフロー的アプローチ] Aurora の HPL は序盤にわずかな性能低下があり、著者らは最適化の余地とみるが、原因は特定していない。フォン・ノイマン型クラスタの実効利用率を論じる主題節に対し、同じ型の機械での実測として HPL 効率 78.84% を並べて読める(Source: [[@2025__arXiv__Aurora - Architecting Argonne's First Exascale Supercomputer for Accelerated Scientific Discovery]])
- **エクサスケール機は APU でなく離散 GPU で実現した**: [[Frontier]] のノードは CPU 1 基と離散 GPU 4 基で、AMD の APU 構想(EHP)は次世代の MI300A まで待った。理由は 3D 積層の量産成熟度と放熱、サーバー IOD 流用の不整合である。(Source: [[@2024__ISCA__Realizing the AMD Exascale Heterogeneous Processor Vision]])
- [定義] Frontier は 1.1 EF(HPL)を 21.1 MW で出し 52 GF/W で、DARPA 2008 報告の 20 MW/EF(50 GF/W)目標を満たした。ただし同報告の定義は、メモリ・ストレージの容量と帯域を 2008 年の 1,000 倍とする資源面を含み、コストを無視した目標だった。DOE は実アプリ高速化(50 倍)に読み替えて評価し、WarpX 500 倍など報告された全件が超えた。HPL の EF と資源 1,000 倍の乖離が、エクサスケールの定義の争点になる(Source: [[@2023__SC__Frontier - Exploring Exascale]], [[@2025__arXiv__Aurora - Architecting Argonne's First Exascale Supercomputer for Accelerated Scientific Discovery]])
- Fugaku は「エクサスケール」を標榜するが、倍精度の HPL は 442 PF(理論ピーク 537 PF)で 1 EF に届かず、1 EF を超えるのは混合精度の HPL-AI(2 EF)である。倍精度の持続性能 1 EF 以上を要件とする Aurora(HPL 1.012 EF/s)の定義とは食い違う。矛盾の callout は source ページ側に置いた(Source: [[@2022__IEEE Micro__Co-Design and System for the Supercomputer Fugaku]]、[[@2025__arXiv__Aurora - Architecting Argonne's First Exascale Supercomputer for Accelerated Scientific Discovery]])
- [定義] 2008 年の DARPA 研究は、エクサスケールを「2010 年のペタスケール系に対し 1 つ以上の重要属性が 1,000 倍」と定め、機能性能・物理属性・応用性能の 3 次元で見る。ただし汎用機として名乗る条件は HPL で 10^18 flops 超である。対象もデータセンター・部門・組込みの 3 種に及び、exaflops 機に限らない。(Source: [[@2008__DARPA__ExaScale Computing Study - Chapter 1 Executive Overview]], [[@2008__DARPA__ExaScale Computing Study - Chapter 2 Defining an Exascale System]]) 倍精度 HPL で 1 EF を要件とする本ページの Aurora 側の定義と、混合精度で 2 EF を名乗る Fugaku の位置づけの食い違いに対し、原典は HPL を基準に置く。
- > [!contradiction] 2008 年の見積もりと実機の食い違い > 第 7・8 章は、積極設計ストローマンでも 1 Eflops に 67.7 MW を要し、20 MW 枠ではシリコンの最良で約 303 Pflops(1 Eflops の約 30%)、"20MW 未満は不可能" と結論した。一方 Frontier は 1.1 EF(HPL)を 21.1 MW で出した。2008 年の予測は電力を約 3 倍過大に見積もった形になる。ただし同報告は積極設計を ECC・クロック配信・冗長化を含まない best case と位置づけ、目標もメモリ・ストレージ容量の 1,000 倍を含む資源面の定義だった。(Source: [[@2008__DARPA__ExaScale Computing Study - Chapter 7 Strawmen - Where Evolution Is and Is Not Enough]], [[@2008__DARPA__ExaScale Computing Study - Chapter 8 Exascale Challenges and Key Research Areas]]), [[@2023__SC__Frontier - Exploring Exascale]]
- 2015 年を目標とした研究会は、エネルギー・電力、メモリ・ストレージ、並行性・局所性、レジリエンシの 4 課題を、既存技術の延長では橋渡しできないものとして挙げた。電力と並行性は全クラスで懸念、他の 2 つはシステム規模が大きいほど重要になる。並行性は 10 億並列が必須でストローマンは傾向より約 5 年早くそれを要求する。(Source: [[@2008__DARPA__ExaScale Computing Study - Chapter 1 Executive Overview]], [[@2008__DARPA__ExaScale Computing Study - Chapter 8 Exascale Challenges and Key Research Areas]])
- ペタスケールは構想(1994 年)から配備見込み(2010 年)まで約 16 年かかった。第 3 章は、明示的な支援なしには、さらに 16 年待ってもエクサスケールの出現は保証されないと述べる。Top500 の外挿では 2010 年に初のペタフロップスなら初のエクサフロップスは 2020 年だが、目標は 2015 年である。(Source: [[@2008__DARPA__ExaScale Computing Study - Chapter 3 Background]])
## 関連
- ソース: [[@2026__HPCAsia__Beyond Exascale - Dataflow Domain Translation on a Cerebras Cluster]] / [[@2025__arXiv__Aurora - Architecting Argonne's First Exascale Supercomputer for Accelerated Scientific Discovery]] / [[@2024__ISCA__Realizing the AMD Exascale Heterogeneous Processor Vision]] / [[@2023__SC__Frontier - Exploring Exascale]] / [[@2022__IEEE Micro__Co-Design and System for the Supercomputer Fugaku]]
- 概念: [[データフローアーキテクチャ]], [[ウェーハスケールエンジン]], [[メモリウォール]], [[ドメイン固有アーキテクチャ]] / [[協調設計]]
- エンティティ: [[Cerebras]], [[Sandia National Laboratories]] / [[Exascale Heterogeneous Processor]]
## 出典
- [[@2026__HPCAsia__Beyond Exascale - Dataflow Domain Translation on a Cerebras Cluster]](エクサスケールシステムにおける地球科学シミュレーションの利用率限界と、データフロー領域平行移動による突破)
- [[@2025__arXiv__Aurora - Architecting Argonne's First Exascale Supercomputer for Accelerated Scientific Discovery]](Aurora の設計と HPL・HPL-MxP の実測)
- [[@2024__ISCA__Realizing the AMD Exascale Heterogeneous Processor Vision]](根拠)
- [[@2023__SC__Frontier - Exploring Exascale]](DARPA 2008 報告の 4 課題に対する Frontier の評価)