# TCCL
PCIe GPU クラスタ向けに探索的により良い通信経路を発見する topology-aware な集団通信スケジューラ(Kim, Ryu, Lee, ASPLOS'24)。[[@2026__TACO__BridgedRing - A Cost-Effective Hardware-Software Co-Design to Overcome the UPI Bottleneck in GPU Servers]] §6.5 では、TCCL の最適スケジュールでもリング型集団通信の周回依存性ゆえに UPI を 1 ホップは経由せざるを得ず、8-GPU スケールでは実行時に共有メモリ過剰確保で失敗することが示されている。