# EPLB
[[DeepSeek-AI]] が開発した Expert Parallelism Load Balancer(EPLB)。MoE モデルの推論において専門家(expert)の配置をデバイス間で最適化し、[[Mixture-of-Experts|エキスパート]]間の負荷不均衡を最小化する。冗長専門家(例: 32 個追加)を配置することで、より柔軟な並列サイズを実現する。
再バランシングは (1) システムロード段階(ディスクからメモリへの重み読込)、(2) 再バランス準備段階(非同期 DMA 転送)、(3) 実行段階(デバイス間コピー)の 3 段階で進む。
[[SGLang]] の 96 H100 GPU 展開では、EPLB によりスループットが Prefill 1.49 倍・Decode 2.54 倍向上した。バランス度とスループットには強い正相関が確認されている。専門家利用分布は Prefill と Decode で異なり、フェーズ別の専門家配置が価値を持つことを示唆する。(Source: [[@2025__LMSYS Blog__Deploying DeepSeek with PD Disaggregation and Large-Scale Expert Parallelism on 96 H100 GPUs]])
## 関連
- エンティティ: [[SGLang]] / [[DeepEP]] / [[DeepSeek-AI]]
- 概念: [[Mixture-of-Experts]] / [[負荷分散]]
- ソース: [[@2025__LMSYS Blog__Deploying DeepSeek with PD Disaggregation and Large-Scale Expert Parallelism on 96 H100 GPUs]]
## 出典
- [[@2025__LMSYS Blog__Deploying DeepSeek with PD Disaggregation and Large-Scale Expert Parallelism on 96 H100 GPUs]]