# Understanding LLM Quantization through Activation-Guided Compensation and Orthogonal Residuals > [!abstract] 概要 > 訓練後の重み-活性化量子化はLLMのメモリと推論コストを削減するが、活性化の外れ値が実効的な量子化分解能を劣化させるため、積極的なW4A4量子化は依然として困難である。重み最適化・チャネル単位スケーリング・直交回転はこの問題を緩和するが、これらが対処する誤差成分とその関係は不明確なままだった。局所的な重み-活性化量子化誤差を、活性化ガイド付き重み補正項と直交残差へ厳密に分解し、持続的チャネル単位外れ値量と正則な活性化量を用いてこの残差を上界評価する。この分解により、重み補正で対処できる誤差成分と、変換設計を要する誤差成分が明確になる。次に、残差の上界を用いて、ランダム化アダマール回転・符号選択・チャネルスケーリングを適用するための実践的指針を導出する。特に、この分析はランダムな符号が持続的外れ値チャネル間の建設的干渉をどう抑制するか、複数の符号パターンをサンプリングすることが変換選択をどう改善しうるか、そして二次モーメントバランシングがL2スケーリング則を導き、さらなる緩和がSmoothQuant式のL∞スケーリングを回復することを説明する。8つのLlamaおよびMistralモデルにわたるバックプロパゲーション不要の構成を通じてこれらの指針を評価し、勾配学習されたSpinQuantに匹敵する性能を得た。 ## 論文情報 - タイトル: Understanding LLM Quantization through Activation-Guided Compensation and Orthogonal Residuals - 著者・所属: Yamato Narita, Issei Sato(東京大学 大学院情報理工学系研究科) - 媒体・発表年: arXiv preprint(Under review)、2026 年 - arXiv ID: 2609.21450([[.raw/papers/arxiv-2609.21450.pdf]]) - コード URL: 本文・付録に記載なし ## 概要 重み-活性化の訓練後量子化(PTQ)における局所誤差を、活性化ガイド付き重み補正(AGWC)項と直交残差に厳密分解する理論枠組みを提案する。直交残差を持続的チャネル外れ値(CO)量と正則(regular)量で上界評価し、ランダム化アダマール回転・符号選択・チャネルスケーリングの設計指針を導出する。バックプロパゲーション不要の実装(L2-SmoothRot)は、8モデルでの実験により勾配学習型 SpinQuant と競合する性能を示す。 ## 問題設定 - 線形層 $Y = XW^\top$(活性化 $X \in \mathbb{R}^{T \times d}$、重み $W \in \mathbb{R}^{d' \times d}$)に対し、可逆変換 $P \in \mathbb{R}^{d \times d}$ を用いて $Z = XP$、$V = WP^{-\top}$ と定義すると $XW^\top = ZV^\top$ が成り立つ。$P$ は full-precision 出力を変えずに量子化器が見る座標表現だけを変える(出力保存変換)。 - 活性化量子化はトークンごとの動的スケール $\Delta_t = \|(Z)_{t,:}\|_\infty / q_A$ によるクリッピングなし対称一様量子化を仮定する($q_A = 2^{b_A-1}-1$)。重み量子化器 $Q_W$ は GPTQ 系の最適化手法など任意の手法でよい。 - 目的関数は局所再構成誤差 $J(P,\tilde V) = \frac{1}{T}\|\tilde Z \tilde V^\top - ZV^\top\|_F^2$(式 2)であり、単一線形層の入力活性化と重みの量子化による出力誤差を測る。 - 活性化を持続的チャネル外れ値モデル(persistent sparse CO model)で分解する: $X = X_{co} + X_{reg}$。$X_{co}$ は較正データ上で検出された持続的外れ値チャネル集合 $C_{co}(X)$ について、トークン共有のレベル $L_k$ を割り当てたもの、$X_{reg}$ はその残差(トークン依存変動+非外れ値チャネル)である。変換 $P = \Lambda^{-1} D H^\top$ は対角スケーリング $\Lambda$・対角符号行列 $D$・正規化アダマール行列 $H$ の合成として定義する。 ## 提案手法 - **アーキテクチャ**: QuaRot の枠組み(オフライン回転+オンライン Hadamard 回転)内で、SmoothRot に倣ったスケーリング配置・融合を用いる。GPTAQ による重み量子化と組み合わせる。 - **誤差分解(Theorem 1)**: $(V^\star)^\top := V^\top - \tilde Z^\dagger A V^\top$、$\Pi_{\tilde Z} := \tilde Z \tilde Z^\dagger$(列空間への直交射影子)と定義すると、局所量子化誤差は $J(P,\tilde V) = J_{AGWC}(P,\tilde V) + \frac{1}{T}\|(I-\Pi_{\tilde Z})AV^\top\|_F^2$ と厳密に分解できる(式 4)。第1項(AGWC)は $\tilde Z$ の列空間に属し量子化重みの変更で削減できるが、第2項(直交残差)は変換 $P$ を固定する限り重み最適化では変えられない。さらに残差は $J(P,\tilde V) \le J_{AGWC}(P,\tilde V) + \frac{2\sqrt{d}}{\sqrt{4q_A^2 T}}\left(\|W\Lambda\|_2\sqrt{J_{co}(\Lambda,D)} + \sqrt{J_{reg}(\Lambda,D)}\right)^2$ で上界評価される(式 5)。$J_{co}$ は持続的外れ値チャネル由来の量、$J_{reg}$ は正則活性化由来の量である。 - **重み補正(§4.2)**: $A=0$ のとき $V^\star = V$ となり $J_{AGWC}$ は標準的な GPTQ 型再構成目的に帰着する。QEP(完全補正・整合入力・非減衰可逆ヘッシアンの下で $V^\star$ に一致)や GPTAQ(逐次更新にチャネル単位残差補正を組み込む)はこの枠組みの特例として位置づけられる。実装では、活性化量子化を有効にした状態で重み較正前に入力誤差を補償する GPTAQ をバックプロパゲーションなしで採用する。 - **ランダム化アダマール回転(Theorem 2, §4.3)**: $N_{co}(X) = |C_{co}(X)|$、$L_{\Lambda,\max} = \max_{k\in C_{co}(X)} |L_k|/\lambda_k$ と定義すると、固定回転($D=I$)では $J_{co} \le \frac{T N_{co}(X)^2}{d} L_{\Lambda,\max}^2$、ランダム符号回転では高確率で $J_{co} \le \frac{2T N_{co}(X)}{d} L_{\Lambda,\max}^2 (\log(2d)+\log(1/\delta))$ となる(式 10, 11)。複数符号パターンをサンプリングする場合はさらに $1/N_s \log(1/\delta)$ の項が加わる(式 12)。固定回転では複数の外れ値チャネルの寄与が建設的に干渉し $N_{co}(X)^2$ 依存になるのに対し、ランダム符号はラーデマッハ和に変換して依存を対数因子まで $N_{co}(X)\log d$ に低減する(付録 A の干渉論に基づく解釈)。 - **L2 スケーリング(Proposition 1, §4.4)**: ランダム符号アダマール回転後、正則量 $J_{reg}$ は高確率で $\frac{2\log(2dT/\delta)}{d}\|W\Lambda\|_2^2 \|X_{reg}\Lambda^{-1}\|_F^2$ で上界評価される(式 13)。この二次モーメント上界の Frobenius 代理 $R^2(\Lambda) = \|W\Lambda\|_F^2\|X_{reg}\Lambda^{-1}\|_F^2$ を最小化すると、Cauchy–Schwarz の等号条件から L2 スケーリング則 $\lambda_k^{(2)} = \sqrt{\|(X_{reg})_{:,k}\|_2 / \|(W)_{:,k}\|_2}$ が導かれる(式 14)。この形は QuIP のリスケーリングと同形だが、QuIP のヒューリスティックな出力誤差代理でなく活性化量子化残差の上界から導出される点が異なる。 - **L2 と SmoothQuant 式 L∞ の統一(§4.5)**: 同じ二次モーメント上界をさらに $L_\infty$ チャネル統計量で上界評価すると(式 15)、$\lambda_k^{(\infty)} = \sqrt{\|(X_{reg})_{:,k}\|_\infty / \|(W)_{:,k}\|_\infty}$(式 16)という SmoothQuant 式のスケーリング則に一致する。L2 は二次モーメントを保持し、L∞ はそれをチャネル最大値へさらに緩和したものとして、両者を同一の残差上界から統一的に説明する。 - **L2-SmoothRot(§4.6)**: 上記の指針を実装した具体構成。(1) Signed Online Rotation(SOR): QuaRot のオンライン Hadamard 回転(attention 出力・FFN down projection の直前)にも符号反転を挿入し、RoPE 後の query/key にも同じ直交符号回転 $R=DH^\top$ を適用($(QR)(KR)^\top = QK^\top$ により注意スコアは不変)。(2) Sign Sampling(SS): オフライン・attention 出力・FFN down・QK 回転の符号パターンを単一シードから同時に選び、RTN でスクリーニングした候補を GPTAQ 再評価後の検証パープレキシティで選択。(3) L2 Scaling(L2S): FFN down-projection 入力にのみ式 17 の L2 スケーリングを適用し、スケーリング係数は up/down 射影重みへ融合するため追加の推論時オーバーヘッドを生じない。 ## 新規性 - 既存の GPTQ 型重み最適化・SmoothQuant 型スケーリング・QuaRot/SpinQuant 型回転は、それぞれ独立したヒューリスティックとして提案されてきたが、どの誤差成分に対処しているか、互いの関係は不明確だった。本研究は局所量子化誤差の厳密分解(Theorem 1)により、重み補正が対処できる範囲(AGWC 項)と変換設計が必要な範囲(直交残差)を分離する共通の理論的視点を与える。 - CoreQ(Cha et al., 2026)の誤差分解と射影恒等式は一致するが、CoreQ は較正データへの過適合抑制に用いるのに対し、本研究は変換依存の残差を持続的外れ値・正則量で上界評価し、回転・スケーリングの設計指針を導く点で異なる。 - QuIP の L2 スケーリングはヒューリスティックな出力誤差代理から導かれるが、本研究は活性化量子化残差の二次モーメント上界から同形の規則を導出し、さらに緩和により SmoothQuant 式 L∞ スケーリングとの共通解釈を初めて与える。 - ランダム化アダマール回転の効果を、持続的外れ値チャネル間の建設的干渉という機構(付録 A)で説明し、固定回転の $O(N_{co}(X)^2)$ 依存からランダム符号の $O(N_{co}(X))$ 依存への改善を理論的に裏付ける。 ## 実験設定 - **モデル**: Llama-7B/13B、Llama2-7B/13B、Llama3-8B、Llama3.2-1B/3B、Mistral-7B-v0.3 の 8 モデル(2 系統、1B〜13B パラメータ)。 - **量子化設定**: W4A4(重み・活性化ともに 4bit)、KV4(K/V も 4bit)。重みはチャネル単位対称量子化、活性化はトークン単位対称量子化、K/V はヘッド単位トークン単位非対称量子化。活性化・K/V のクリッピング比はそれぞれ 0.9・0.95。 - **較正**: GPTAQ は WikiText-2 訓練サンプル 128 件を使用し、局所活性化誤差と伝播した重み・活性化・K/V 誤差を非量子化パス出力に対して較正する。スケーリング統計量は変換前・非量子化モデルの WikiText-2 訓練サンプル 512 件から算出。SpinQuant の回転学習プロトコルに従い、16bit 重み・4bit 活性化/K/V を固定して WikiText-2 訓練データで 100 ステップ回転を学習した後、GPTAQ で量子化。 - **回転選択(L2-SmoothRot)**: RTN で 10 候補をスクリーニングし、上位 3 候補を GPTAQ で再評価、WikiText-2 検証パープレキシティが最小のものを選択。 - **比較対象**: QuaRot・SmoothRot・SpinQuant(すべて同一の GPTAQ 重み量子化設定を適用)。 - **評価指標**: WikiText-2(WT2)テストと C4 検証サブセットの各 64 サンプルによるパープレキシティ(PPL)。ゼロショット精度は PIQA・ARC-Easy(ARC-E)・ARC-Challenge(ARC-C)・HellaSwag(HS)・WinoGrande(WG)・LAMBADA(LB)の 6 タスク平均。 ## 実験結果 表 1 は 8 モデルにわたる W4A4 の主結果である(付録 C の表 3 が C4 パープレキシティと個別タスク精度の全結果)。 **Table 1: W4A4 results with GPTAQ weight quantization and KV4 across model families and scales.** | Model | W16A16 PPL↓ | W16A16 Avg.↑ | QuaRot PPL↓ | QuaRot Avg.↑ | SmoothRot PPL↓ | SmoothRot Avg.↑ | SpinQuant PPL↓ | SpinQuant Avg.↑ | L2-SmoothRot PPL↓ | L2-SmoothRot Avg.↑ | |---|---|---|---|---|---|---|---|---|---|---| | Llama-7B | 5.67 | 69.39 | 6.12 | 66.17 | 6.13 | 66.16 | 6.19 | 66.18 | 6.09 | 66.67 | | Llama-13B | 5.05 | 71.78 | 5.42 | 69.49 | 5.42 | 69.09 | 5.44 | 69.31 | 5.37 | 69.91 | | Llama2-7B | 5.47 | 69.82 | 5.96 | 66.32 | 5.98 | 66.45 | 6.06 | 65.98 | 5.94 | 66.59 | | Llama2-13B | 4.86 | 72.57 | 5.24 | 69.87 | 5.26 | 70.15 | 5.26 | 70.23 | 5.23 | 70.50 | | Llama3-8B | 5.94 | 73.30 | 7.45 | 65.71 | 7.57 | 65.85 | 7.33 | 68.36 | 7.20 | 68.10 | | Llama3.2-1B | 9.41 | 59.80 | 13.81 | 49.58 | 14.13 | 48.63 | 13.33 | 50.37 | 12.92 | 50.71 | | Llama3.2-3B | 7.55 | 68.20 | 9.27 | 61.12 | 9.35 | 59.91 | 9.19 | 62.03 | 9.08 | 60.94 | | Mistral-7B-v0.3 | 5.35 | 73.73 | 5.73 | 70.55 | 5.77 | 69.80 | 5.74 | 71.17 | 5.71 | 71.00 | - L2-SmoothRot は 8 モデル全てで WikiText-2 パープレキシティが最小であり、5 モデルで平均ゼロショット精度が最高となった。C4 パープレキシティも全モデルで最小であり、パープレキシティ改善が較正・回転選択に使った WikiText-2 に限定されないことを示す。 - Llama3-8B と Mistral-7B-v0.3 では、平均精度が SpinQuant にそれぞれ 0.26 ポイント・0.17 ポイント差まで接近する。Llama3.2-3B ではパープレキシティは SpinQuant を上回るが、平均精度は 1.09 ポイント下回る。 **Table 2: Component ablation on Llama3-8B with GPTAQ (W4A4KV4).** | QuaRot | SOR ($J_{co}$) | SS ($J_{co}$) | L2S ($J_{reg}$) | PPL↓ | |---|---|---|---|---| | ✓ | | | | 7.45 | | ✓ | ✓ | | | 7.30 | | ✓ | | ✓ | | 7.40 | | ✓ | | | ✓ | 7.32 | | ✓ | ✓ | ✓ | ✓ | 7.20 | - QuaRot(7.45)を起点に、SOR(QK 回転含む)・SS・L2S を個別に追加するとそれぞれ 7.30・7.40・7.32 に改善し、SOR が単独では最大の改善を与える。全成分を組み合わせると 7.20 まで改善する。SOR と SS は主に $J_{co}$、L2S は $J_{reg}$ を標的とする設計と整合するが、量子化誤差への効果が独立とは限らない、と論文は留保している。 **Figure 1: RTN-based seed-selection ablation on Llama3-8B with GPTAQ** ![[_attachments/arxiv-2609.21450/fig01-seed-selection-ablation.png]] (Figure 1. Llama3-8B・W4A4・KV4・GPTAQ 設定で、100 個のランダム回転シードについて RTN 検証・GPTAQ 検証/テストパープレキシティを事前計算し、候補数 $N \in \{4,10,16,32\}$ ごとに 1000 試行(非復元抽出)で top-1(RTN 検証最良を選択)と top-3(RTN 上位 3 候補を GPTAQ 検証パープレキシティで再選択)を比較した箱ひげ図。両選択則とも一様選択(全シード平均、破線)より平均 GPTAQ テストパープレキシティを改善し、候補数が増えるほど改善する。top-3 は top-1 を一貫して上回るが、その優位は $N=16$ から $N=32$ にかけて縮小する。) ## 考察 - Theorem 1 の分解は、活性化誤差 $A$ がゼロのとき標準的な GPTQ 型再構成に帰着する特殊ケースとして既存手法を統一的に位置づける。活性化誤差が非ゼロのとき、共有入力再構成(shared-input reconstruction)は量子化活性化を使っていてもこの誤差を明示的に補償しない、という限界を指摘する。 - L2 スケーリングの導出において、重み側のスペクトルノルム $\|W\Lambda\|_2$ はチャネル間の相互作用まで反映するが、目的関数がチャネルごとに分離できないため、Frobenius 代理を用いてチャネル単位の閉形式規則に緩和している。この緩和が L2 と L∞ スケーリングを統一的に説明できる根拠になっている。 - Seed-selection ablation は、GPTAQ 実行 1 回で済む top-1 と、3 回の実行を要する top-3 のトレードオフを定量化し、RTN スクリーニングが低コストな回転選択基準として機能することを示す。 ## 強み / 弱点・課題 - **Strengths**: 既存の重み補正・回転・スケーリング手法を単一の誤差分解から統一的に説明する理論枠組みを提示し、バックプロパゲーションなしで勾配学習型 SpinQuant に匹敵する性能を達成している点。 - **Weaknesses/Limitations**: 持続的チャネル外れ値モデル(式 3)は解析のための抽象化であり、実装では正則成分 $X_{reg}$ を明示的に分離せず経験的な全活性化統計量で近似している。SOR・SS・L2S の量子化誤差への効果が独立であるとは限らないと論文自身が留保しており、成分間の相互作用の定量化は残された課題である。評価は W4A4/KV4 という単一のビット幅設定と Llama/Mistral 系列に限られる。