# 紹介: Optimizing Deployment Configurations for LLM Inference: Challenges and Insights Navigation: [[index]] | [[wiki/sources/@2026__MLSys2026__Optimizing Deployment Configurations for LLM Inference|Optimizing Deployment Configurations for LLM Inference (source)]] 対応する source ページの配布用紹介文。Slack 等へ貼るための圧縮であり、source 本文の再要約ではない。 ## 紹介文 - Metaが月間約10億人に提供するLlamaのLLM推論では、モデル・入力分布・ハードウェア・並列化・ランタイムの組合せが数百万通りに膨らみ、手作業の調整では追い切れない。 - オンライン応答とオフライン処理ではTTFT・TTIT・スループットの要求が大きく違うため、全ワークロードに効く単一の最適構成は存在しない。 - Metaは各ハードウェアで演算子をマイクロベンチマークし、実測ベースの軽量性能シミュレータで構成候補を体系的に探索する枠組みを作った。 - モデル分割や通信・ランタイムのオーバーヘッドを含む実行グラフからTTFT・TTIT・QPSを推定し、SLOを満たす構成だけをランキングする。 - 評価ではLlama3 70B・405BとMoE構成を、最大256カードの複数GPUプロファイル上で継続的バッチングと分離推論の両方に組み合わせて比較した。 - シミュレータの予測誤差は実機測定に対して±5%以内で、大規模な設計探索に使える精度を確認した。 - 厳しいオンラインSLOではPrefill/Decode分離が継続的バッチングより70Bで1.5〜1.8倍、405Bで1.8〜2.2倍のQPSを出し、Metaはオンラインサービスの大半を移行して約30%の容量を削減した。 - Prefillは計算バウンド、Decodeはメモリ帯域バウンドなので、PrefillをPP4-TP2、DecodeをTP8のようにフェーズごとに並列化するのが効く。 - Prefillに高演算性能のGPU、Decodeに高メモリ帯域のGPUを割り当てる異種構成は、同種構成と同等のQPSを15〜25%低いTCOで達成した。 - MoEではEPがAllReduceの負担を避けやすく、密モデルではスケールアップが必要な場面でもスケールアウトを伸ばせる。 - 実務的なメッセージは「モデル・ワークロード・ハードウェアの組合せごとに測って選ぶ」であり、匿名化ハードウェアや仮想MoEに基づく結果の一般化には注意が要る。 --- Meta Inference Team (Meta Platforms, Inc.), "Optimizing Deployment Configurations for LLM Inference: Challenges and Insights," MLSys:3780, 2026. https://mlsys.org/virtual/2026/oral/3780 ## 出典 - [[wiki/sources/@2026__MLSys2026__Optimizing Deployment Configurations for LLM Inference|Optimizing Deployment Configurations for LLM Inference]]