# GPTQ GPTQ [192] は、学習済みLLMの重みを再学習なしに低ビット整数へ変換する事後量子化(Post-Training Quantization; PTQ)手法であり、重みのみ量子化(Weight-only Quantization)の早期の代表手法である。従来の逐次量子化アルゴリズムOBQ [221](行ごとに最適な量子化順序を、非量子化重みに対するヘシアン行列に基づく再構成誤差で決める)を出発点とするが、OBQは量子化の各ステップでヘシアン行列を頻繁に更新するため計算量が増大する問題を抱えていた。GPTQは各行を左から右への一様な順序で量子化することで、ヘシアン行列の計算を1行の量子化時のみに限定し、その結果を後続行へ再利用することで、大規模なヘシアン行列更新を回避し量子化手順全体を高速化した。(Source: [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 5.1 Model Compression - Quantization]] §5.2.1) Table 3(同章)では、GPTQは重みのみを一様量子化(Uniform)し、量子化パラメータを統計ベース(Statistic-based)で決定し、量子化過程で非量子化重みの値更新(補償)を行う手法として分類される。QuantEase [200] はGPTQを基盤に座標降下法で非量子化重みの補償を精緻化する改良を提案しており、GPTQの量子化重みをQuantEaseの初期値として利用できる。(Source: [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 5.1 Model Compression - Quantization]] §5.2.1 Post-Training Quantization) ## 関連 - ソース: [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 5.1 Model Compression - Quantization]] - 関連手法: [[AWQ]] / [[SmoothQuant]] - 概念: [[量子化]] ## 出典 - [[@2024__arXiv__A Survey on Efficient Inference for Large Language Models - Chapter 5.1 Model Compression - Quantization]](§5.2.1 Post-Training Quantization、Table 3)