# NCCLX [[Meta]] が開発した集合通信フレームワーク。NVIDIA の [[NCCL]] ライブラリを基盤としつつ拡張し、Llama4 の開発・展開を支えるために作られた。PyTorch の下層で動作し、10万 GPU 超のクラスタ上で訓練の同期要求から推論の低レイテンシ要求まで、LLM ライフサイクル全体の通信を一元管理する。(Source: [[@2025__arXiv__Collective Communication for 100k+ GPUs]], §1) - 中核はホスト駆動・ゼロコピー・SM フリーを設計原理とするカスタムトランスポート [[CTran]] で、host-initiated / GPU 常駐メタデータ付き host-initiated / device-initiated の三実行モードを統一スタックで提供する(§3)。 - 輻輳管理に [[DQPLB]](Dynamic Queue Pair Load Balancing)を備え、Llama3 比でスイッチバッファ蓄積を一桁削減する。 - 公開コードは [[torchcomms]](`github.com/meta-pytorch/torchcomms` の `comms/ncclx`)。 [[@2026__SIGCOMM__Connecting 100K+ GPUs - Building the Communication Stack for Large-Scale LLM Training]](SIGCOMM 2026、同一著者グループ)は本フレームワークを **CCLX** という NVIDIA/AMD 横断のブランド名に一般化し、NVIDIA プラットフォーム版を NCCLX、AMD プラットフォーム版を RCCLX と呼び分ける(footnote 1)。同論文は多建屋物理トポロジのレイテンシ階層(ラック内比 7×/15×/30×)という新しい定量的文脈のもとで、初期化を 96K GPU 規模で最大 11 倍高速化(265.0秒→24.0秒)、64K GPU 規模で通信子あたり GPU メモリ使用量を約 2 倍削減という、先行 arXiv 版と整合する数値を再確認・詳細化した。(Source: [[@2026__SIGCOMM__Connecting 100K+ GPUs - Building the Communication Stack for Large-Scale LLM Training]], §3.2, §3.3) ## 関連 - ソース: [[@2025__arXiv__Collective Communication for 100k+ GPUs]] / [[@2026__SIGCOMM__Connecting 100K+ GPUs - Building the Communication Stack for Large-Scale LLM Training]] - エンティティ: [[NCCL]] / [[CTran]] / [[DQPLB]] / [[torchcomms]] / [[Llama4]] / [[Meta]]