# MegaScale-Infer Navigation: [[index]] | [[overview]] ## 定義 MegaScale-Infer は [[ByteDance Seed]] が開発した、大規模 [[Mixture-of-Experts]](MoE)モデルを費用対効果よく提供するための推論サービングシステムである。各モデル層の attention モジュールと FFN(エキスパート)モジュールを別々の GPU ノードへ分離してデプロイする [[Disaggregated Expert Parallelism]] を中核設計とし、ping-pong pipeline parallelism と専用の M2N 通信ライブラリを組み合わせる。約 10,000 GPU 規模のクラスタで本番提供されており、異種混在デプロイ下でワークロード特性に応じて 1.5〜2.0 倍のコスト削減を達成している。(Source: [[@2025__arXiv__MegaScale-Infer - Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism]]) ## 未編纂の観察 - [3D-DRAM 世代の attention-FFN 分離との対応] [[@2026__ISCA__Early Silicon of Raptor - The First 3D-DRAM Accelerator for Generative Inference]] は、MoE デコードを小さな TP グループのアテンションと EP で分散されたエキスパートに分ける disaggregated デプロイメント(AFD、Attention-FFN Disaggregation)を評価し、「アクティベーション交換は既存の EP 用 all-to-all に融合できる」実装例として MegaScale-Infer の「Step-3」を引用している。Raptor がアテンションを GPU・FFN/エキスパートを 3D-DRAM アクセラレータへ振り分けるハードウェア異種混在を前提とするのに対し、MegaScale-Infer は GPU 同士(H20 と L40S 等)の異種混在で同じ AFD パターンを実現しており、AFD というアーキテクチャパターンがハードウェア世代を越えて再利用されていることを示す。(Source: [[@2025__arXiv__MegaScale-Infer - Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism]], [[@2026__ISCA__Early Silicon of Raptor - The First 3D-DRAM Accelerator for Generative Inference]]) ## 関連 - ソース: [[@2025__arXiv__MegaScale-Infer - Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism]] - 概念: [[Disaggregated Expert Parallelism]] / [[Mixture-of-Experts]] - エンティティ: [[ByteDance Seed]] / [[vLLM]] / [[TensorRT-LLM]] / [[NCCL]] / [[DeepEP]] ## 出典 - [[@2025__arXiv__MegaScale-Infer - Serving Mixture-of-Experts at Scale with Disaggregated Expert Parallelism]](本エンティティの一次ソース)