# El Capitan Hardware Overview ## 概要 LLNL の [[El Capitan]] と、同じ構成要素(ATS-4)の姉妹機(Tuolumne、El Dorado、rzAdams)のハードウェアを述べた公式ドキュメントである。APU、ノード、メモリ階層、CPU・GPU、システム相互接続を扱う。 ## ATS-4 系 4 機種の比較 | | El Capitan | Tuolumne | El Dorado | rzAdams | | --- | --- | --- | --- | --- | | ノード数 | 11,520 | 1,152 | 384 | 128 | | ノードあたり MI300A | 4 | 4 | 4 | 4 | | MI300A 総数 | 46,080 | 4,608 | 1,536 | 512 | | ノードピーク(DP TFLOP/s) | 250.8 | 250.8 | 250.8 | 250.8 | | システムピーク(DP PFLOP/s) | 2,889.2 | 288.9 | 96.3 | 32.1 | | システムピーク(SP PFLOP/s) | 3,815.0 | 381.5 | 127.2 | 42.4 | | システムピーク(HP PFLOP/s) | 18,248.4 | 1,824.8 | 608.2 | 202.8 | | ノードメモリ(GiB、すべて HBM3) | 512 | 512 | 512 | 512 | | システムメモリ(TiB) | 5,760 | 576 | 192 | 64 | | 計算キャビネット | 90 | 9 | 3 | 1 | | ピーク電力(MW) | 36.0 | 3.6 | 1.2 | 0.4 | | Rabbit モジュール総数 | 720 | 72 | 24 | 8 | | 2024 年 11 月 Top500 順位 | 1 | 12 | 33 | 72 | El Dorado は Sandia National Laboratories に設置されている。 ## システム概要 - 全機が同じ構成要素(APU=CPU+GPU、ノード、システム相互接続、ファイルシステム)を使う。計算ノードは [[AMD Instinct MI300A]] 4 基を持ち、各ソケットが 128 GB のメモリと 1 つの NUMA ドメインを成し、ノード合計 512 GB である。 - MI300A は CPU チップレットと GPU チップレット、メモリ側キャッシュの AMD Infinity Cache、HBM3 の 8 スタック、I/O インタフェース、Infinity Fabric を 1 パッケージに再配置した構成である。垂直積層の加速器複合ダイ(XCD)6 枚と I/O ダイ(IOD)4 枚を Infinity Fabric で結び、8 スタックの HBM3 に接続する。 - CPU 複合ダイ(CCD)3 基が CPU コアを、XCD 6 基が並列の GPU エンジンを提供する。XCD と CCD は統合 HBM3 メモリシステムを共有し、コピー無しで CPU・GPU のどちらからも直接ロード・ストアできる。CPU はすべての CPU・GPU とハードウェアコヒーレントである。 - 各プロセッサは、帯域 256 GB/s の Infinity Fabric リンク 2 本で他のプロセッサと全結合される。 **Figure 1: El Capitan ノード図** ![[_attachments/el-capitan-hardware-overview/fig01-node-diagram.png]] (MI300A 4 基を xGMI3 で全結合し、各 APU に Cassini(200G Slingshot)が接続される。ニアノードのローカルストレージへは PCIe-G4 ×4 の 8 GB/s/方向で接続する。) ## メモリ階層(CDNA 3) - L2 は 4 MB・16 ウェイで、16 チャネル(各 256 KB)を持ち、XCD 内の 38 CU 全体で共有する。XCD あたり 1 クロックで 4 CU からの要求を維持し、合計 2 KB/クロックである。 - AMD Infinity Cache はメモリ側キャッシュで、ダーティデータを保持せずコヒーレンシに参加しないため、スヌープを処理する必要が無く効率が上がりレイテンシが下がる。16 ウェイで、HBM 各スタックに 16 チャネル、チャネルは 64 バイト幅で 2 MB のデータ配列に接続する。4 つの IOD にまたがる 8 スタックで 128 チャネル・256 MB、ピーク帯域は 17.2 TB/s。 - HBM3 は 5.2 Gbps のバスで、1 スタックが 16 GB または 24 GB。ソケットあたり 128 GB、理論ピーク帯域 5.3 TB/s である。 ## CPU と GPU - CPU: 1 APU あたり Zen 4 の 24 コア(x86、AVX-512、BFloat16)。CCD ごとに 8 コアが 32 MB の L3 を共有する。 - GPU: 1 APU あたり 6 XCD。理論ピークは倍精度ベクトルで 61.3 TFLOPS。 | MI300A のピーク性能 | TFLOPS | | --- | --- | | FP64 ベクトル | 61.3 | | FP32 ベクトル | 122.6 | | FP64 行列 | 122.6 | | FP32 行列 | 122.6 | **Figure 2: MI300A の論理ブロック図** ![[_attachments/el-capitan-hardware-overview/fig02-mi300a-block.png]] (6 つの XCD(各 CU 群と L2)と 3 つの CCD が Infinity Fabric で結ばれ、その下に Infinity Cache と 8 スタックの HBM が並ぶ。) - XCD は共有のグローバル資源(スケジューラ、ハードウェアキュー)と 4 つの非同期計算エンジン(ACE)を持つ。ACE はそれぞれ 40 CU に関連づくが、歩留まり管理のため有効は XCD あたり 38 CU で、2 個は無効化されている。 ## システム相互接続 - HPE Slingshot のスイッチでドラゴンフライトポロジ([[ドラゴンフライトポロジ]])。高基数の 64 ポート・双方向 25.6 Tb/s のスイッチで、各ポートは片方向最大 200 Gbps(25 GB/s)。 - ノードあたり Slingshot 200 GbE インタフェース 4 本で、ノードの注入帯域は合計 100 GB/s。 ## 出典 - 原本: `.raw/articles/el-capitan-hardware-overview-2026-09-21.md`(2026-09-21 取得。掲載日はページに記載が無く、2024 年 11 月の Top500 順位を含む)