# MSCCL++ [[Microsoft]]が開発するGPU通信抽象の再考を掲げるcollective communicationライブラリ(Hwang+, ASPLOS 2026「MSCCL++: Rethinking GPU communication abstractions for AI inference」)。GitHub: https://github.com/microsoft/mscclpp 。 [[@2026__arXiv__CCL-Bench 1.0 - A Trace-Based Benchmark for LLM Infrastructure]]は、Perlmutter A100上でvLLM推論(Qwen3-4B/Llama-3.1-8B/DeepSeek-MoE-16B)を対象に[[NCCL]]とMSCCL++をワークロード・ハードウェア・フレームワーク・TP/EP次数・アクセラレータ数を固定して比較した。通信比率は一貫してMSCCL++が有利(Qwen3-4B: 49.5%→46.5%、DeepSeek-MoE-16B: 53.7%→46.4%)だが、レイテンシへの効果はワークロード依存(Qwen3-4B・DeepSeek-MoEは改善、Llama-3.1-8Bは36.6ms→38.4msへ悪化)であった——通信削減が必ずしもend-to-endレイテンシ改善に直結しないことを示す実例。 ## 関連 - 本ソース: [[@2026__arXiv__CCL-Bench 1.0 - A Trace-Based Benchmark for LLM Infrastructure]] - 開発元: [[Microsoft]] - 比較対象: [[NCCL]] - 評価基盤: [[CCL-Bench]]