# Zhen Zheng [[Microsoft]] 所属、[[@2024__arXiv__BatchLLM - Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batching]](arXiv:2412.03594, MLSys 2026 Industry Track 採録)の対応著者(`[email protected]`)。Xin Ji・Taosong Fang(ISCAS からのインターン)・Fanghao Zhou・Chuanjie Liu・Gang Peng と共同で、大規模バッチ・オフライン LLM 推論に特化したグローバルプレフィックス共有と token バッチングの最適化 BatchLLM を提案した。vLLM v0.6.4 上に実装し、vLLM・SGLang に対し 1.3〜10.8 倍のスループット向上を達成した。 [[@2026__MLSys2026__Kitty - Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost]](MLSys 2026)でも [[Shuaiwen Leon Song]]([[Together AI]])と共同責任著者を務め、KV キャッシュのチャネル単位混合精度量子化 Kitty を提案した。BatchLLM(スケジューリング・プレフィックス共有)と Kitty(量子化・メモリレイアウト)は、KV キャッシュ効率化という共通テーマへの異なる切り口の貢献。 ## 関連 - ソース: [[@2024__arXiv__BatchLLM - Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batching]] / [[@2026__MLSys2026__Kitty - Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost]] - 所属: [[Microsoft]] - 共著: [[Shuaiwen Leon Song]] - 関連概念: [[LLM推論]] / [[KVキャッシュ管理]] / [[KVキャッシュ量子化]]