# Vista TACC(Texas Advanced Computing Center)が運用する AI 特化・空冷のスパコン。クラスタ全体で GH200 600 台・600 ノード([[@2026__TPDS__Quantifying Performance Variability in GPU Clusters]] Table I)。GPUPerf・GPU 性能変動特性化の両論文で評価テストベッドとして用いられている。 - 構成: NVIDIA Grace CPU Superchip + GH200(96GB HBM3)、1 GPU/ノード、ノード内 NVLink-C2C(900 GB/s)、ノード間 NVIDIA NDR InfiniBand(400 Gb/s)、最大 128 ノード(128 GH200)。(Source: [[@2025__arXiv__Efficient Fine-Grained GPU Performance Modeling for Distributed Deep Learning of LLM]]) - GPUPerf は単一 GPU/ノードの統合メモリ(GH200 + InfiniBand)というハードウェアパラダイムを代表する環境として用い、平均予測誤差 **9.38%**(一貫した過小評価傾向)。全通信がノード間 InfiniBand を通るためネットワークジッタ・輻輳に脆弱で、対照の [[Perlmutter]] より誤差・変動が大きいと結論づけている(Source: [[@2025__arXiv__Efficient Fine-Grained GPU Performance Modeling for Distributed Deep Learning of LLM]])。 - 注: GPUPerf 論文の表V の見出しは「H200-96GB HBM3」と表記し本文の GH200 と表記ゆれがあるが、本文・abstract に従い GH200 として扱う。 - [[@2026__TPDS__Quantifying Performance Variability in GPU Clusters]] は 518 台の GH200 を用いて GEMM マイクロベンチマークの GPU 間性能変動を直接実測し、Tensor Cores で 3.7〜6.3%、CUDA Cores で 0.1〜4.5% と定量化した(Table II 参照)。ノード c640-041・c621-102 は精度を問わず複数実験で最遅 3 台の一角として一貫して出現する。この実測は、GPUPerf が Vista の高い予測誤差の原因として挙げる「ネットワークジッタ・輻輳」に加えて、GPU ハードウェア自体の個体差も予測誤差に寄与しうることを示唆する([[GPU性能変動]]の横断的知見を参照)。 ## 関連 - ソース: [[@2025__arXiv__Efficient Fine-Grained GPU Performance Modeling for Distributed Deep Learning of LLM]] / [[@2026__TPDS__Quantifying Performance Variability in GPU Clusters]] - 対照テストベッド: [[Perlmutter]] - 概念: [[LLM分散学習]] / [[GPUクラスタ運用]] / [[並列化戦略]] / [[GPU性能変動]]