# Haojun Xia [[University of Sydney]] 所属、[[@2026__MLSys2026__Kitty - Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost]](MLSys 2026)の共同筆頭著者。Xiaoxia Wu・Jisen Li と共同で、Key キャッシュのチャネル単位量子化感度に基づく Dynamic Channel-wise Precision Boost と、page-centric な KV メモリレイアウト・Triton 融合逆量子化カーネルを提案した。論文の参考文献には Flash-LLM(VLDB 2023)・Quant-LLM(USENIX ATC 2024)といった低精度・スパース GPU 推論の既発表研究も含まれ、GPU 向け低ビット推論システム設計を継続的に扱っている。 ## 関連 - ソース: [[@2026__MLSys2026__Kitty - Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost]] - 所属: [[University of Sydney]] - 関連概念: [[KVキャッシュ量子化]] / [[モデル圧縮]]