# COCCL COCCL (Customized-Compression-Optimized Collective Communication Library) は、中国科学院大学(UCAS)の [[Dingwen Tao]] 教授らの研究グループおよび Ant Group らによって開発された、NVIDIA [[NCCL]] 互換の高性能集合通信ライブラリである。([[@2026__HPCA__COCCL - A Collective Communication Library Supporting Easy Integration and Configuration of Customized Compression for Scalable LLM Training]]) ## 主な機能と特徴 1. **統一圧縮プログラミングモデル (UCPM)**: フレームワーク層の改修を不要とし、わずか約 100 行の C++/CUDA コードでユーザ定義の圧縮・解凍ルーチンやリダクション融合カーネルを動的ライブラリとして統合できる。 2. **PCCA (Compression-Accelerated Collective Primitive)**: 圧縮、AlltoAll、解凍を一体化した汎用基本操作を導入し、従来のリング型アルゴリズムで発生していた段数比例の圧縮オーバーヘッドと累積誤差伝播を原理的に排除する。 3. **多段階アルゴリズム体系**: 小規模向けの 1-shot (単一 PCCA + 局所リダクション)、クラスタ規模拡大向けの 2-shot (ノード内 PCCA + ノード間 PCCA)、超大規模向けの 3-shot アルゴリズムを提供。 4. **トポロジ駆動型 2 段階オーバーラップ**: 同一トポロジ内でのデータチャンク非同期パイプライン(1-Level)と、ノード内・ノード間階層間の非同期パイプライン(2-Level)により、圧縮の計算時間を効果的に隠蔽する。 5. **3D 並列学習の次元固有圧縮 (COCCL-3D)**: データ並列(DP)の重み・勾配には SDP4Bit、パイプライン並列(PP)の活性化値には TAHQuant を適用し、誤差蓄積に極めて脆弱なテンソル並列(TP)通信は非圧縮とすることで、モデル精度を損なわずにエンドツーエンド訓練を最大 1.24 倍加速する。 ## 関連 - ベースライブラリ: [[NCCL]] - 主要技術: [[集合通信]]、[[勾配圧縮]]、[[LLM分散学習]]、[[PTD-P]] - 開発者: [[Xingchen Liu]]、[[Dingwen Tao]]、中国科学院大学 (UCAS)、[[Ant Group]] - コードリポジトリ: https://github.com/hpdps-group/COCCL - 関連ソース: [[@2026__HPCA__COCCL - A Collective Communication Library Supporting Easy Integration and Configuration of Customized Compression for Scalable LLM Training]]