# Disaggregated Expert Parallelism Navigation: [[index]] | [[overview]] ## 定義 Disaggregated Expert Parallelism(Attention-FFN Disaggregation、AFD)は、[[Mixture-of-Experts]](MoE)モデルのデコード推論において、各モデル層の attention モジュールと FFN(エキスパート)モジュールを別々の GPU(またはアクセラレータ)ノードへ分離してデプロイする設計である。attention はデータ並列で複製し、エキスパートはエキスパート並列(EP)でノード間に分散することで、両モジュールを独立にスケールし異種混在ハードウェアへ配置できる。MoE の疎な活性化により FFN が受け取るトークン数(ひいては GPU 使用率)が縮小するという問題に対し、複数の attention ノードからのリクエストを 1 つのエキスパートノードに集約することでバッチサイズを回復し、GPU 使用率とコスト効率を改善する。([[@2025__arXiv__MegaScale-Infer - Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism]]) ## 未解決の問い - ハードウェア世代(GPU 同士の異種混在 vs GPU + 3D-DRAM アクセラレータのような異種混在)によって AFD の最適な分離粒度・通信パターンはどう変わるか。 - エキスパート数がさらに増加し(例: 数百エキスパート級)、接続あたりの転送データ量が小さくなった場合、attention-FFN 間通信は CPU 主導方式([[MegaScale-Infer]] の M2N)と GPU 主導方式([[DeepEP]])のどちらが有利になるか。 ## 未編纂の観察 - **AFD というアーキテクチャパターンがハードウェア世代を越えて再利用されている**: [[@2025__arXiv__MegaScale-Infer - Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism]] は attention と FFN(エキスパート)を GPU 同士(例: H20 と L40S)の異種混在で分離する disaggregated expert parallelism を提案し、ping-pong pipeline parallelism で disaggregation が生む idle time を隠蔽し、専用の M2N 通信ライブラリ(CPU-to-CPU、NCCL 比最大 9.9 倍スループット)で通信オーバーヘッドを抑える。[[@2026__ISCA__Early Silicon of Raptor - The First 3D-DRAM Accelerator for Generative Inference]] は同じ AFD パターンを、attention を GPU・FFN/エキスパートを 3D-DRAM アクセラレータへ振り分ける異なるハードウェア世代で採用し、「アクティベーション交換は既存の EP 用 all-to-all に融合できる」実装例として MegaScale-Infer の Step-3 を引用している。両者は分離の動機(コスト最適化 vs メモリ帯域の底上げ)が異なるが、「attention と FFN を独立にスケール可能な単位として切り離す」という設計原則を共有する。(Source: [[@2025__arXiv__MegaScale-Infer - Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism]], [[@2026__ISCA__Early Silicon of Raptor - The First 3D-DRAM Accelerator for Generative Inference]]) - **AFD は M2N という新しい通信パターンを要求し、既存の集団通信ライブラリの前提と合わない**: MoE 層内で完結していた All2All 通信は、AFD により M 個の attention ノードと N 個のエキスパートノード間の M2N 通信に変わる。MegaScale-Infer は NCCL の GPU-to-CPU 中間コピー・8 個単位の group operation・汎用セットアップオーバーヘッドがこのパターンに適さないことを実測し(1対N レイテンシで NCCL は perftest 比大幅に劣化)、専用ライブラリで解決した。(Source: [[@2025__arXiv__MegaScale-Infer - Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism]]) ## 関連 - ソース: [[@2025__arXiv__MegaScale-Infer - Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism]] / [[@2026__ISCA__Early Silicon of Raptor - The First 3D-DRAM Accelerator for Generative Inference]] - 概念: [[Mixture-of-Experts]] / [[Prefill-Decode分離]] - エンティティ: [[MegaScale-Infer]] / [[DeepEP]] / [[NCCL]] ## 出典 - [[@2025__arXiv__MegaScale-Infer - Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism]](AFD の原論文。ping-pong pipeline parallelism と M2N 通信ライブラリを提案) - [[@2026__ISCA__Early Silicon of Raptor - The First 3D-DRAM Accelerator for Generative Inference]](3D-DRAM アクセラレータ世代での AFD 適用例)