# DQPLB [[NCCLX]] の輻輳管理機構。Dynamic Queue Pair Load Balancing の略で、接続種別・トポロジ別に未確認データ量を制御し、Llama3 比でスイッチバッファの蓄積を一桁削減する。(Source: [[@2025__arXiv__Collective Communication for 100k+ GPUs]]) 1 つの Control QP と複数の Data QP を用い、宛先あたりの QP 数・セグメントサイズ・未確認メッセージ数の 3 パラメータの積をパスの BDP に合わせて調整する。`IBV_WR_RDMA_WRITE_WITH_IMM` のイミディエイトデータにシーケンス番号・fast path フラグ・通知フラグを埋め込み、受信側のスライディングウィンドウで順序保証を維持する。[[@2026__SIGCOMM__Connecting 100K+ GPUs - Building the Communication Stack for Large-Scale LLM Training]] は「一桁削減」を具体的な数値で追加検証し、32〜128 GPU の All-to-Allv でバッファウォーターマークを 90%(32 GPU)〜75%(128 GPU)削減、256 GPU AllGather で 1GB メッセージのピークバッファを 72% 削減しつつ 8MB メッセージの帯域幅を 13% 改善した。(Source: [[@2026__SIGCOMM__Connecting 100K+ GPUs - Building the Communication Stack for Large-Scale LLM Training]], §4.2, §4.3) ## 関連 - ソース: [[@2025__arXiv__Collective Communication for 100k+ GPUs]] / [[@2026__SIGCOMM__Connecting 100K+ GPUs - Building the Communication Stack for Large-Scale LLM Training]] - エンティティ: [[NCCLX]]