# 訓練後量子化
## 定義
訓練後量子化(Post-Training Quantization、PTQ)とは、少量の較正データのみを用い、大規模言語モデル(LLM)を全体の再訓練なしに低ビット表現へ変換する手法群である。メモリ使用量と推論コストの削減を目的とし、重みのみを量子化する方式と、重みと活性化(activation)の双方を量子化する weight-activation quantization に大別される。GPTQ 型手法は量子化された重みを最適化して full-precision の層出力を保存し、AWQ のような活性化認識型手法は活性化統計量を用いて顕著な重みチャネルを保護する。重みのみの量子化と比べ、積極的な低ビットの重み-活性化量子化(例: W4A4)は、活性化量子化が入力依存の誤差を導入し、大きな活性化値が量子化範囲を拡大して通常値の実効分解能を低下させるため、より困難である。(Source: [[@2026__arXiv__Understanding LLM Quantization through Activation-Guided Compensation and Orthogonal Residuals]])
## 未解決の問い
- 重み補正(weight compensation)・[[アダマール回転]]などの座標変換・チャネルスケーリングは、それぞれ独立したヒューリスティックとして提案されてきたが、これらが量子化誤差のどの成分に対処し、互いにどう関係するかは手法横断で統一的に説明されてこなかった(Source: [[@2026__arXiv__Understanding LLM Quantization through Activation-Guided Compensation and Orthogonal Residuals]])。