# ヘテロジニアスコンピューティング
## 定義
ヘテロジニアスコンピューティングは、汎用の高機能プロセッサと、専用のアクセラレータのように性格の異なる演算器を 1 つの計算機に組み合わせて、性能と電力効率を両立させる方式である。[[Roadrunner]] は、汎用の Opteron と同数の [[PowerXCell 8i]] を対にして 1 Pflop/s を超えた例で、ピーク性能の約 95% をアクセラレータが担う。(Source: [[@2008__SC__Entering the Petaflop Era - The Architecture and Performance of Roadrunner]])
## 未解決の問い
- アクセラレータの局所記憶(ローカルストア)と主記憶、ホストとの間の転送が、深い通信階層の中でどこまで性能を律速するか。他システムでも同じ構造が現れるか。
- 利用形態(未改変コード、急所のみ移植、全計算を移す SPE 中心モデル)のうち、どれが保守性と性能の両面で有利か。
- GPU 併用の効果が 1.5 倍(S3D)から 6.5 倍(LAMMPS)まで開く要因(加速可能な演算の割合、算術強度、通信の重なり)を、同一の指標で切り分けられるか。
## 未編纂の観察
- 同じ HPE Cray EX 系でも、ヘテロジニアスの実現形が 2 通りある。Perlmutter は CPU 専用 3,072 ノードと GPU 搭載 1,792 ノードを別パーティションに分ける。El Capitan は 1 パッケージに CPU(Zen 4 の 24 コア)と GPU(6 XCD)を載せた MI300A を全ノードに使い、統合 HBM3 をコピー無しで共有する(Source: [[@2026__NERSC__Perlmutter Architecture]], [[@2026__LLNL HPC__El Capitan Hardware Overview]])
- Titan は 1 ノードに Opteron 16 コアと GPU 1 個を組み合わせ、CPU と GPU を別パーティションにも 1 パッケージにもせず、同一ノード内で HyperTransport-3 から PCI-express 2 への変換チップ経由(双方向 10.4 GB/s)でつなぐ形をとる。GPU を載せない XK6 ノードも混在させ、GPU 付きノードは Titandev の 960 個(第 1 段階)から 3,648 ブレード分(Kepler 搭載時)へ広げる計画だった。CPU と GPU の間の細い接続が、アプリケーションの移植方針(データを GPU 側に置き続ける、通信を GPU ループの外へ出す)を左右している(Source: [[@2012__CUG__Titan - Early experience with the Cray XK6 at Oak Ridge National Laboratory]])
- [ヘテロジニアスの利用形態] Roadrunner が SPE 中心モデルでコードを再構成したのに対し、Titan は MPI に OpenMP・OpenACC/CUDA を重ねる階層的並列性を採り、ディレクティブ(OpenACC)で移植性を確保する方針を推す。同じ機能の GPU カーネルを CPU でも動かせる構成(DENOVO のスイープ、S3D の OpenMP/OpenACC 切替)を重視する点が、SPE 専用に書き直す Roadrunner と対照的である(Source: [[@2012__CUG__Titan - Early experience with the Cray XK6 at Oak Ridge National Laboratory]], [[@2008__SC__Entering the Petaflop Era - The Architecture and Performance of Roadrunner]])
## 関連
- ソース: [[@2008__SC__Entering the Petaflop Era - The Architecture and Performance of Roadrunner]] / [[@2026__NERSC__Perlmutter Architecture]] / [[@2026__LLNL HPC__El Capitan Hardware Overview]] / [[@2012__CUG__Titan - Early experience with the Cray XK6 at Oak Ridge National Laboratory]]
- 概念: [[スーパーコンピュータ]] / [[メモリウォール]]
- システム: [[Roadrunner]] / [[Titan]]
## 出典
- [[@2008__SC__Entering the Petaflop Era - The Architecture and Performance of Roadrunner]]
- [[@2026__NERSC__Perlmutter Architecture]](パーティション分割型の構成(CPU 専用と GPU 搭載))
- [[@2026__LLNL HPC__El Capitan Hardware Overview]](CPU・GPU 統合 APU(MI300A)による構成)