# RCCL
## 概要
ROCm Collective Communication Library。GPU 間の集団通信を専門とし、MPI と同様の 1 対 1 通信ルーチンも持つ。単一プロセスでは単体で、複数プロセスでは MPI と併用する。
## MI300A での性質
- 1 対 1 通信は最大 88 GB/s に達し、アロケータ(malloc / hipMalloc / hipMallocManaged)と SDMA の状態にほとんど影響されない。
- 小メッセージのレイテンシ床は約 20 μs で、MPI(CPU ステージング 1.9 μs)の約 10 倍高い。
- 4 KB 超の集団通信では MPI の 5〜38 倍低遅延(ReduceScatter は最大 20〜38 倍)である。
- CloverLeaf の RCCL 版は XNACK 無効だと RCCL 内部エラーで停止した。
## 関連
- 概念: [[集合通信]] / [[GPU-Aware MPI]]
- ソース: [[@2025__MemSys__Inter-APU Communication on AMD MI300A Systems via Infinity Fabric - A Deep Dive]]