# RCCL ## 概要 ROCm Collective Communication Library。GPU 間の集団通信を専門とし、MPI と同様の 1 対 1 通信ルーチンも持つ。単一プロセスでは単体で、複数プロセスでは MPI と併用する。 ## MI300A での性質 - 1 対 1 通信は最大 88 GB/s に達し、アロケータ(malloc / hipMalloc / hipMallocManaged)と SDMA の状態にほとんど影響されない。 - 小メッセージのレイテンシ床は約 20 μs で、MPI(CPU ステージング 1.9 μs)の約 10 倍高い。 - 4 KB 超の集団通信では MPI の 5〜38 倍低遅延(ReduceScatter は最大 20〜38 倍)である。 - CloverLeaf の RCCL 版は XNACK 無効だと RCCL 内部エラーで停止した。 ## 関連 - 概念: [[集合通信]] / [[GPU-Aware MPI]] - ソース: [[@2025__MemSys__Inter-APU Communication on AMD MI300A Systems via Infinity Fabric - A Deep Dive]]