# A Survey on Efficient Inference for Large Language Models
## 概要
Zixuan Zhou ほか(Infinigence-AI / Tsinghua University / Shanghai Jiao Tong University / Tsinghua Shenzhen International Graduate School / Peking University)による arXiv プレプリント。**非効率の原因分析からタクソノミーを導く**構成を取り、LLM 推論の非効率を (1) 巨大なモデルサイズ、(2) attention の二乗複雑度、(3) 自己回帰復号方式、の 3 因に帰したうえで、効率化手法を **data-level / model-level / system-level** の 3 層へ整理する。**代表手法の比較実験を自ら行い定量的な洞察を与える**点が、多くのサーベイと異なる。
> [!abstract] 概要(arXiv abstract の日本語訳)
> 大規模言語モデル(LLM)は多様なタスクで顕著な性能を示し、大きな注目を集めている。しかし、LLM 推論の大きな計算・メモリ要求は、資源制約のあるシナリオへの展開に課題をもたらす。研究分野では、LLM 推論効率を高める技術の開発が進められてきた。本論文は、効率的な LLM 推論に関する既存文献の包括的サーベイを提示する。まず、非効率な LLM 推論の主因、すなわち大きなモデルサイズ、二乗複雑度の attention 操作、自己回帰復号方式を分析する。次に、既存文献を data-level、model-level、system-level optimization に整理する包括的タクソノミーを導入する。さらに、重要なサブフィールドの代表手法に関する比較実験を含め、定量的洞察を提供する。最後に、知識の要約と将来の研究方向を議論する。
## 書誌情報
- 著者: Zixuan Zhou, Xuefei Ning, Ke Hong, Tianyu Fu, Jiaming Xu, Shiyao Li, Yuming Lou, Luning Wang, Zhihang Yuan, Xiuhong Li, Shengen Yan, Guohao Dai, Xiao-Ping Zhang, Huazhong Yang, Yuhan Dong, Yu Wang
- 所属: [[Infinigence-AI]] / [[Tsinghua University]] / [[Shanghai Jiao Tong University]] / Tsinghua Shenzhen International Graduate School / [[Peking University]]
- 媒体: arXiv:2404.14294v3
- 投稿: 2024-07-19
- URL: https://arxiv.org/abs/2404.14294
- 構成: 全 11 章(36 PDF ページ)
- 原本: `.raw/theses/arxiv-2404.14294/`
## 構成と主要テーマ
全 11 章は、原因分析(第 1〜3 章)・**data-level**(第 4 章)・**model-level**(第 5.0〜5.2 章)・**system-level**(第 6.0〜6.2 章)・展望(第 7 章)に分かれる。**第 3 章のタクソノミーが第 4 章以降の章構成そのものになっている**。
- **第 1〜3 章(原因分析とタクソノミー)**: [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 1 Introduction]] が計算コスト・メモリアクセスコスト・メモリ使用量という 3 つの負荷を示し、先行 8 サーベイに対して「3 階層の網羅」と「比較実験の実施」の 2 点を差分として主張する(Table 1)。[[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 2 Preliminaries]] が **Prefilling と Decoding の 2 段階**を定義し、8 つの効率指標と**非効率の 3 根本原因**(モデルサイズ・注意演算の二乗複雑度・自己回帰復号)を導く。[[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 3 Taxonomy]] がその 3 原因への対処として 3 階層を立てる。
- **第 4 章(data-level)**: [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 4 Data-level Optimization]]。入力圧縮(prompt pruning / summary / soft prompt / RAG)と出力構造化(SoT → SGD → APAR → SGLang)の 2 系統。**モデルを変更しないため再学習が不要**である。
- **第 5.0〜5.2 章(model-level)**: [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 5.0 Model-level Optimization - Efficient Structure Design]] が効率的 FFN 設計(MoE)・効率的 attention 設計・Transformer 代替(SSM 系譜)の 3 系統、[[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 5.1 Model Compression - Quantization]] が量子化(PTQ / QAT、重みのみ / 重み+活性値)、[[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 5.2 Model Compression - Sparsification, Structure Optimization, Distillation, and Dynamic Inference]] がスパース化・構造最適化・知識蒸留・動的推論を扱う。**事前学習またはファインチューニングを要し、性能に対して非可逆**である。
- **第 6.0〜6.2 章(system-level)**: [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 6.0 System-level Optimization - Inference Engine]] が演算子/グラフ最適化と投機的デコーディング、[[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 6.1 System-level Optimization - Serving System]] がオフローディング・メモリ管理・継続的バッチング・スケジューリング・分散システム、[[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 6.2 System-level Optimization - Hardware Accelerator and Framework Comparison]] が FPGA アクセラレータと推論エンジン 7 種の比較(Table 6)を扱う。**モデル学習を伴わず、性能に対して可逆**である。
- **第 7 章(展望)**: [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 7 Discussions of Key Application Scenarios and Conclusion]]。エージェント・長文脈・エッジデバイスの 3 シナリオと、**効率化が安全性を損なうかがほとんど検証されていない**という指摘。
## 位置づけと影響
- **3 階層が「何を代償に効率を買うか」で切られている**点が本サーベイの分類の眼目である。data-level は再学習不要、model-level は**性能に対して非可逆**、system-level は**性能に対して可逆**。効率化技術を選ぶときの意思決定軸が、そのまま分類軸になっている。
- **比較実験に踏み込む**。量子化(Table 4)と推論エンジン(Table 6)については著者ら自身が測定しており、**重みのみ量子化(W4A16, AWQ)が decoding とエンドツーエンドの遅延を改善する一方で prefilling 遅延はむしろ悪化しうる**、**バッチサイズと入力長が増えるほど高速化幅は縮む**という、手法の列挙だけでは出てこない知見が得られている。
- **Prefilling / Decoding の非対称性が全階層を貫く**。Prefilling は GEMM で演算律速、Decoding は GEMV でメモリアクセス律速である。この違いが、量子化方式の使い分け(第 5.1 章)・投機的デコーディングの成立条件(第 6.0 章)・Prefill/Decode 分離アーキテクチャ(第 6.1 章の Splitwise・TetriInfer・DistServe)のすべての根拠になっている。
- **同主題のサーベイ [[Towards Efficient Generative Large Language Model Serving]] との差**: あちらは**サービング**(低レイテンシと高スループットの同時要求)を出発点にアルゴリズムとシステムの 2 軸を立てるのに対し、本サーベイは**推論そのものの非効率の原因分析**から 3 階層を導く。本サーベイの system-level 章があちらの守備範囲とほぼ重なる。
- **効率と安全性の交差が空白である**。第 7 章は「効率化技術が LLM の安全性を損なうかどうかはほとんど扱われていない」と明示する。3 階層の格子のどこにも安全性の軸がないことが、この空白を可視化している。
## 関連
- 概念: [[LLM推論]] / [[KVキャッシュ管理]]
## 出典
- Zixuan Zhou et al., "A Survey on Efficient Inference for Large Language Models", arXiv:2404.14294, 2024.