# KVキャッシュ量子化 ## 定義 KVキャッシュ量子化とは、LLM 推論で保持する key/value テンソルの数値精度を FP16 から低ビット(4-bit・2-bit 等)へ落とすことで、[[KVキャッシュ管理]] が扱うメモリフットプリント問題を圧縮率の面から緩和する技術である。[[モデル圧縮]] の 4 カテゴリ(量子化・プルーニング・低ランク近似・知識蒸留)のうち量子化に属するが、重み量子化とは異なり、KV キャッシュは推論中に動的に生成・成長するため、事前計算した静的スケールではなく実行時にスケール・重要度を決定する必要がある点が特有の課題になる。per-channel(Key に多い)・per-token(Value に多い)の量子化軸、および均一精度と混合精度(重要な要素のみ高精度に保つ)の設計軸が存在する。(Source: [[@2026__MLSys2026__Kitty - Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost]]) ## 横断的知見 - (この概念は Kitty 論文の ingest から新設したため、複数ソースを突き合わせた横断的知見はまだない。次に量子化系論文——KIVI・KVQuant・ZeroQuant(4+2) 等——を ingest した際に、トークン単位 vs チャネル単位の混合精度戦略や、量子化アルゴリズムとページ管理システムの協調設計パターンを比較する形で蓄積する。) ## 未解決の問い - Kitty のチャネル単位精度ブースト(Dynamic Channel-wise Precision Boost)と、KVQuant のようなトークン単位・outlier 単位の混合精度手法は、両方を組み合わせた場合に相加的な精度改善が得られるか、それとも同じ誤差源を重複してカバーするため効果が飽和するか。 - Kitty のマグニチュードベースのチャネル選択ヒューリスティックは、[[Grouped-Query Attention]] で Key ヘッドが複数 Q ヘッドに共有される構成において、Q ヘッドごとに感度パターンが異なる場合(Figure 2b で観測されたわずかな差)にどこまで頑健か。ヘッドごとに異なるブースト比率を割り当てる設計は精度・システム複雑性のトレードオフをどう変えるか。 - Kitty の page-centric レイアウト(混合精度ページを 2 つの統一 2-bit テンソルに分解)は、[[PagedAttention]] のブロック管理や [[KVキャッシュ管理]] が扱う CPU/SSD への階層退避と組み合わせた場合、量子化済みページの転送・復元コストはどう変わるか。 - Kitty はモデル・タスクによってチャネルブースト比率(12.5% vs 25%)の最適値が異なる(LLaMA3.3-70B-Instruct では Kitty が Kitty-Pro よりわずかに劣る)。ブースト比率を実行時にタスク・入力難易度に応じて動的に調整する設計は可能か。 - Triton 実装による逆量子化オーバーヘッドの隠蔽は著者ら自身が proof-of-concept と位置づける。CUDA 等より低レベルな実装でのオーバーヘッド削減余地は、他の量子化推論システム(KIVI の実装、[[vLLM]] の量子化サポート等)と比べてどの程度あるか。 ## 関連 - ソース: [[@2026__MLSys2026__Kitty - Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost]] - 概念: [[KVキャッシュ管理]] / [[モデル圧縮]] / [[LLM推論]] / [[Grouped-Query Attention]] - エンティティ: [[Haojun Xia]] / [[Shuaiwen Leon Song]] / [[Zhen Zheng]] / [[Together AI]] / [[University of Sydney]] ## 出典 - [[@2026__MLSys2026__Kitty - Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost]](Dynamic Channel-wise Precision Boost、page-centric メモリレイアウト、Triton 融合逆量子化カーネル、MLSys 2026)