# Towards Efficient Generative Large Language Model Serving ## 概要 Xupeng Miao(Purdue University)・Gabriele Oliaro・Zhihao Zhang・Xinhao Cheng・Hongyi Jin・Tianqi Chen・Zhihao Jia(Carnegie Mellon University)による ACM Computing Surveys 掲載のサーベイ。**「アルゴリズムからシステムまで」を副題に掲げ、アルゴリズム的革新とシステム最適化を 2 本の柱として対置する**構成を取る。**低レイテンシと高スループットが同時に求められるサービング**という運用上の要請を出発点に置く点が、訓練側や推論手法単体のサーベイと分かれる。 > [!abstract] 概要(abstract の日本語訳) > 急速に進化する人工知能(AI)の環境において、生成型大規模言語モデル(LLM)は最前線に立ち、データとの対話方法に革命をもたらしている。しかしながら、これらのモデルの展開に伴う計算の集約性とメモリ消費は、とりわけ低レイテンシと高スループットが求められる場面でサービング効率に関する大きな課題を呈している。本サーベイは、機械学習システム(MLSys)研究の視点から効率的な LLM サービング手法の切実な必要性に応えるものであり、先端的な AI 革新と実用的なシステム最適化の交差点に立っている。最先端のアルゴリズム的改良からシステム設計の根本的な変革に至る、幅広い解決策を網羅する詳細な分析を提供する。本サーベイは、効率的な LLM サービングの現状と将来の方向性について包括的な理解を提供し、効果的な LLM 展開の障壁を克服するための貴重な洞察を研究者と実務者に届け、AI の未来を再形成することを目指す。 ## 書誌情報 - 著者: [[Xupeng Miao]]([[Purdue University]])、[[Gabriele Oliaro]]・[[Zhihao Zhang]]・[[Xinhao Cheng]]・[[Hongyi Jin]]・[[Tianqi Chen]]・[[Zhihao Jia]]([[Carnegie Mellon University]]) - 媒体: ACM Computing Surveys, Vol. 58, No. 1, Article 15 - 発表: 2025-09 - DOI: 10.1145/3754448 - 構成: 全 7 章(37 PDF ページ) - 原本: `.raw/theses/survey-2025-generative-llm-serving/` ## 構成と主要テーマ 全 7 章は、背景(第 1 章)・**2 本柱のタクソノミー**(第 3.1〜3.2 章)・実装と評価(第 4〜5 章)・展望(第 7〜8 章)に分かれる。副題「アルゴリズムからシステムまで」が示すとおり、**アルゴリズム的革新とシステム最適化を対置する二分法が全章を貫く**。 - **第 1 章(背景)**: [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 1 Introduction and Background]]。Transformer と GPU の基礎、自己回帰復号の疑似コードを置いたうえで、**§2.4 の 5 課題**(レイテンシ・メモリ・スケーラビリティ・ハードウェア互換性・精度対効率)を提示する。この 5 課題が以降の章構成の動機になる。 - **第 3.1 章(アルゴリズム的革新)**: [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 3.1 Taxonomy - Algorithmic Innovation]]。復号アルゴリズム・アーキテクチャ設計・モデル圧縮の 3 部門。**投機的復号は、非自己回帰復号・早期脱出・カスケード推論と異なり、ドラフトの予測を元の LLM で検証するため出力分布を変えずに並列性を高められる唯一の手法**として位置づけられる。アテンション単純化は Selective・Sliding+Dilated・Global token・Hash-based の 4 パターンに整理される(Table 1)。 - **第 3.2 章(システム最適化)**: [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 3.2 Taxonomy - System Optimization]]。**LLM の計算セマンティクスを変更せず**基盤を洗練する手法群として、低ビット量子化・並列計算・メモリ管理・リクエストスケジューリング・カーネル最適化の 5 主題を扱う。 - **第 4〜5 章(実装と評価)**: [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 4 Software Frameworks]] が 10 のオープンソース GPU ベースサービングシステムを 4 軸で比較する(Table 2)。[[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 5 Benchmarks and Connection with Other Surveys]] は**本番トレース(BurstGPT・Azure)を使ったベンチマークが主流だが、MLPerf のような包括的で再現可能なベンチマークはこの分野にまだ存在しない**と述べ、先行サーベイとの差別化を示す。 - **第 7〜8 章(展望)**: [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 7 Future Direction]] がハードウェアアクセラレータ・効率的な復号・長コンテキスト・代替アーキテクチャ・複雑な環境へのデプロイ・要求への自動適応の 6 方向を挙げる。[[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 8 Conclusion]] は効率的な LLM サービングを**先端 AI 技術へのアクセスの民主化に向けた基盤的なステップ**と位置づけて締めくくる。 ## 位置づけと影響 - **分類の軸が「LLM の計算セマンティクスを変えるかどうか」に置かれている**。アルゴリズム的革新は出力の分布や計算そのものに手を入れ、システム最適化は入れない。この線引きが 2 本柱の意味であり、**投機的復号がアルゴリズム側にありながら「出力分布を変えない」という例外的な位置を占める**ことが際立つ。 - **低レイテンシと高スループットが「相補的だがしばしば競合する」双対の目標**という診断が、実装比較の読み方を決めている。Table 2 の「優先目標」列は、vLLM が PagedAttention でバッチサイズを拡大してスループット側へ、FlexFlow-Serve が SpecInfer で逐次復号を速めてレイテンシ側へ、それぞれ軸足を置くことを示す。**サービングという設定に固有のトレードオフ**であり、推論手法単体のサーベイには現れない。 - **同主題の [[A Survey on Efficient Inference for Large Language Models]](Zhou ほか、2024)との関係**: あちらは推論の非効率の**原因分析**から data-level / model-level / system-level の 3 階層を導く。本サーベイの第 3.2 章はあちらの system-level 章とほぼ守備範囲が重なるが、本サーベイは**低レイテンシと高スループットの同時要求という運用上の設定**を出発点に置く点で異なる。なお本サーベイの参考文献に Zhou ほかへの直接の引用は見当たらず、担当は推測でリンクを張らずその旨を記録した。 - **ベンチマークの不在を明言する**。BurstGPT・Azure という本番トレースへ接地していてもなお、モデル構成 × ハードウェア × リクエスト負荷という評価設定空間の網羅性が担保されなければ結論の信頼性は損なわれる。この論点は [[本番接地型ベンチマーク]] に記録した。 - **vault との接続**: [[スパース注意]] に、本サーベイ Table 1 の 4 分類が既存の「静的/動的」2 軸では捉えきれない**第 3 の軸としてハッシュベース**を明らかにすること、および同じ手法群が既存ノートではキャッシュ管理層、本サーベイではアテンション計算層という**異なる層で語られる**ことを記録した。 - **限界**: 対象は CUDA/ROCm エコシステムの成熟度を理由に GPU に絞られ、他ハードウェア向けの特化解(PopTransformer・CTranslate2・llama.cpp・ggml)や他システム上のデプロイ解(OpenLLM・LMDeploy・DeepSpeed-MII ほか)は比較の対象外である。 ## 関連 - 概念: [[LLM推論]] / [[モデル圧縮]] / [[並列化戦略]] / [[Mixture-of-Experts]] / [[Webロードバランシング]] ## 出典 - Xupeng Miao et al., "Towards Efficient Generative Large Language Model Serving: A Survey from Algorithms to Systems", *ACM Computing Surveys* 58(1):15, 2025.