# AWQ
AWQ [194](Activation-aware Weight Quantization)は、重みのみ量子化(Weight-only Quantization)に属する事後量子化(PTQ)手法である。重みチャネルの重要度は一様でなく、活性値に外れ値を持つ入力チャネルに整合する重みチャネルほど性能への寄与が大きいという観察に基づく。重要な重みチャネルを保護するため、再パラメータ化手法を用いて再パラメータ化係数をグリッドサーチで選び、再構成誤差を効果的に最小化する。(Source: [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 5.1 Model Compression - Quantization]] §5.2.1 Post-Training Quantization)
Table 3(同章)では、AWQは重みのみを一様量子化(Uniform)し、量子化パラメータを探索ベース(Search-based)で決定し、量子化過程で値更新(補償)を行う手法として分類される。同章の比較実験(Table 4)では、著者らがLLaMA-2-7B/13BをAWQアルゴリズムで4ビット量子化(W4A16)し、TensorRT-LLM・LMDeployの2フレームワーク上で実際の速度向上を測定した。(Source: [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 5.1 Model Compression - Quantization]] §5.2.1 Comparative Experiments and Analysis)
## 関連
- ソース: [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 5.1 Model Compression - Quantization]]
- 関連手法: [[GPTQ]] / [[SmoothQuant]]
- 概念: [[量子化]]
## 出典
- [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 5.1 Model Compression - Quantization]](§5.2.1 Post-Training Quantization、Table 3、Comparative Experiments and Analysis Table 4)