# Perlmutter
NERSC(National Energy Research Scientific Computing Center)が運用する液冷のスパコン。クラスタ全体で A100 6144 台・1536 ノード([[@2026__TPDS__Quantifying Performance Variability in GPU Clusters]] Table I)。GPUPerf・GPU 性能変動特性化の両論文で評価テストベッドとして用いられている。
- 構成: AMD EPYC 7763 + NVIDIA A100(40GB/80GB HBM2e)、4 GPU/ノード、Slingshot 11 インターコネクト(4 NIC/ノード)。(Source: [[@2026__TPDS__Quantifying Performance Variability in GPU Clusters]]。GPUPerf 論文は A100-SXM4(40GB HBM2)・NVLink 3.0・Slingshot-10 と記す表記ゆれがある。)
- GPUPerf はマルチ GPU ノード(A100-SXM4 + NVLink)というハードウェアパラダイムを代表する環境として用い、最大 20B・128 GPU で平均予測誤差 **4.98%** を達成した。一部の集合通信をノード内で実行できるため、対照の [[Vista]] より予測の安定性が高い。(Source: [[@2025__arXiv__Efficient Fine-Grained GPU Performance Modeling for Distributed Deep Learning of LLM]])
- [[@2026__TPDS__Quantifying Performance Variability in GPU Clusters]] は 512 台の A100 を用いて GEMM の GPU 間性能変動を実測し、Tensor Cores で 5.0〜8.8%、CUDA Cores で 0.1〜8.2% と、Vista よりむしろ高い変動を定量化した(Table II 参照)。GPU 性能変動そのものは Perlmutter の方が Vista より大きいにもかかわらず、GPUPerf の予測誤差は Perlmutter の方が小さい——ノード内 NVLink による集合通信の安定性が、GPU 個体差由来の変動の影響を打ち消しうることを示唆する([[GPU性能変動]]の横断的知見を参照)。
[[CCL-Bench]]([[@2026__arXiv__CCL-Bench 1.0 - A Trace-Based Benchmark for LLM Infrastructure]])は、Perlmutterを主要評価環境の一つとして採用した(各ノード4基のA100 GPU、NVLink 3.0で300GB/s単方向のscale-upドメイン、Slingshot-11ファブリックで200Gbpsのscale-outドメイン)。TPU v6e(Torus)との対比実験、NCCL/MSCCL++の通信ライブラリ比較、CCL-Searchによるフレームワーク間チューニング探索など、本論文の主要ケーススタディの実行基盤となった。(Source: [[@2026__arXiv__CCL-Bench 1.0 - A Trace-Based Benchmark for LLM Infrastructure]])
## 関連
- ソース: [[@2025__arXiv__Efficient Fine-Grained GPU Performance Modeling for Distributed Deep Learning of LLM]] / [[@2026__TPDS__Quantifying Performance Variability in GPU Clusters]] / [[@2026__arXiv__CCL-Bench 1.0 - A Trace-Based Benchmark for LLM Infrastructure]] / [[@2026__IPDPS__Characterizing Production GPU Workloads using System-wide Telemetry Data]]
- 対照テストベッド: [[Vista]]
- 概念: [[LLM分散学習]] / [[GPUクラスタ運用]] / [[並列化戦略]] / [[GPU性能変動]] / [[HPCワークロード特性化]] / [[GPU観測性]]
- ベンチマーク: [[CCL-Bench]]
- エンティティ: [[NERSC]] / [[LDMS]] / [[NVIDIA Data Center GPU Manager]]
- ソース: [[@2026__IPDPS__Characterizing Production GPU Workloads using System-wide Telemetry Data]](1 か月 DCGM/LDMS テレメトリ、75,703 GPU ジョブの特性化)
- 運用機関: [[NERSC]]