# DeepEP
DeepSeek が開発した高スループットのエキスパート並列(EP)通信ライブラリ(github.com/deepseek-ai/DeepEP)。MoE モデルにおけるトークンのディスパッチ/コンバインを高効率に実行する。
[[Composer 2]] の訓練で EP のトークン分配に使用される。通信バッファのオーバーヘッドが低く、デフォルトで 20 SM を使用して並行計算の余地を残す。Composer 2 ではディスパッチ前にトークンを MXFP8 へ量子化して通信効率を向上させ、コンバインは BF16 で精度を維持する。
[[SGLang]] の 96 H100 GPU 展開では、DeepEP を **Normal Dispatch**(長入力最適化、Prefill 向け、CUDA Graph 非対応)と **Low-Latency Dispatch**(出力生成最適化、Decode 向け、CUDA Graph 対応)の 2 モードで統合し、[[Prefill-Decode分離|PD Disaggregation]] により Prefill/Decode で異なるモードを同時に使い分けた。Prefill 側では normal dispatch の出力を [[DeepGEMM]] の連続レイアウトへ変換するカスタム Triton カーネルが併用される。(Source: [[@2025__LMSYS Blog__Deploying DeepSeek with PD Disaggregation and Large-Scale Expert Parallelism on 96 H100 GPUs]])
## 出典
- [[@2026__arXiv__Composer 2 Technical Report]] §6.1
- [[@2025__LMSYS Blog__Deploying DeepSeek with PD Disaggregation and Large-Scale Expert Parallelism on 96 H100 GPUs]]