# LLM推論設計空間探索 ## 定義 LLM推論設計空間探索とは、モデル・ハードウェア・並列化戦略・ランタイム構成の組み合わせが数百万規模に達する LLM 推論デプロイメントの設計空間を、実測ベンチマークに基づく性能シミュレーションで体系的に走査し、レイテンシ SLO(TTFT・TTIT)を満たしつつスループット(QPS)を最大化する構成を特定する手法である。手動・ヒューリスティックな構成選定が組合せ爆発により破綻する規模で、演算子レベルのマイクロベンチマーク・区分線形補間・探索空間刈り込み・SLO 制約付きランキングを組み合わせて実現する。(Source: [[@2026__MLSys2026__Optimizing Deployment Configurations for LLM Inference]]) ## 横断的知見 - **組合せ爆発の規模感が定量化された**: Meta の本番運用では、ランタイム構成(バッチサイズ・最適化技術の組み合わせ)だけで約1,000通り、5次元並列化(TP・PP・EP・CP・DP)だけで約1,000通りとなり、モデル・ハードウェアの選択肢を掛け合わせると総組合せ数はしばしば100万を超える。この規模では手動・ヒューリスティックな構成選定は現実的でなく、体系的探索が必須になる。(Source: [[@2026__MLSys2026__Optimizing Deployment Configurations for LLM Inference]]) - **軽量シミュレータは実機比±5%の精度をマイクロベンチマークの区分線形補間で達成する**: 解析的モデルやサイクルレベルシミュレータに対する優位性は、GEMM・attention・AllReduce・AlltoAll 等の演算子をハードウェアごとに10万件超マイクロベンチマークし、多次元区分線形補間/外挿でオペレータ性能モデル F(op, H, shape) を構築する点にある。LLM の演算子種類が数十程度に限られることが、この実測駆動アプローチの実行可能性を支えている。(Source: [[@2026__MLSys2026__Optimizing Deployment Configurations for LLM Inference]]) - **継続的バッチングと分離推論では QPS 算出式そのものが異なり、シミュレータは両者を統一的に扱う必要がある**: 継続的バッチングでは TTFT が Prefill、TTIT が混在した Prefill/Decode レイテンシに依存するのに対し、分離推論では独立プールのそれぞれの性能で TTFT/TTIT が決まる。QPS_cluster は Prefill/Decode 双方の最適構成を独立に求めたのち、処理速度を均衡させるアクセラレータ比率を算出して導出する。ランタイムアーキテクチャの違いがそのまま性能推定モデルの構造の違いになる。(Source: [[@2026__MLSys2026__Optimizing Deployment Configurations for LLM Inference]]) - **探索空間の刈り込みは、2のべき乗の並列化次数と標準8GPUトポロジへの限定によって現実的な計算量に収める**: メモリ容量制約や SLO 違反構成を早期に破棄しつつ、標準的なハードウェアトポロジに合致する構成へ絞ることで、GB200 NVL72 等の非標準トポロジにも対応しながら数分単位でのシミュレーション実行を可能にする。(Source: [[@2026__MLSys2026__Optimizing Deployment Configurations for LLM Inference]]) - **投機的デコードと MoE ルーティングは、静的な演算子モデルでは捉えられない動的要素として別途モデル化される**: 投機的デコードは draft トークン数と受理率でバッチサイズをスケールし、MoE エキスパートルーティングは実測トークン分布で負荷不均衡を捕捉する。両者とも「演算子の実行時間」という静的な性能モデルの前提を超える、ワークロード依存の動的性を扱う拡張が必要になる。(Source: [[@2026__MLSys2026__Optimizing Deployment Configurations for LLM Inference]]) ## 未解決の問い - シミュレータの精度検証(±5%)は中央値・平均値に主眼を置いており、ネットワークジッタ等に起因する P99 テールレイテンシの予測精度は評価されていない。テール SLO を厳密に扱うにはどのような拡張が必要か。 - 将来ハードウェアの性能推定はシミュレーションベースの演算子性能推定をデータベースにアップロードする方式で対応するとされるが、この推定自体の精度検証(実機投入後の答え合わせ)は論文中に示されていない。ベンチマーク不能な新規ハードウェアに対する推定誤差はどの程度か。 - MoE のエキスパート活性化数予測モデル(load balanced・uniform random・log-linear)は本番トラフィックへの適合度で log-linear が選ばれたが、この選択はワークロード分布(エージェント種別・セッション長)に依存しうる。トラフィックパターンが変化した場合、予測モデルの選択をどう動的に切り替えるべきか。 - 本論文のシミュレータは公開されておらず、他組織が同様の手法を再現する際に必要な演算子ベンチマークデータベースの構築コストがどの程度かは論文からは分からない。オープンなベンチマークデータセット(例: Vidur、LLMServingSim 等の既存シミュレータの入力データ)との統合は可能か。 - 探索空間刈り込みは2のべき乗の並列化次数を前提とするが、これは現在の8GPU/host トポロジに最適化された仮定である。今後のハードウェア世代でホストあたりGPU数が変化した場合、刈り込み戦略はどう一般化されるべきか。 ## 関連 - ソース: [[@2026__MLSys2026__Optimizing Deployment Configurations for LLM Inference]] - 概念: [[Prefill-Decode分離]] / [[並列化戦略]] / [[Mixture-of-Experts]] - エンティティ: [[Meta]] ## 出典 - [[@2026__MLSys2026__Optimizing Deployment Configurations for LLM Inference]](Meta、軽量性能シミュレータによる数百万規模の展開構成探索、MLSys 2026 Industry Track)