# LMSYS
Large Model Systems Organization の略。[[University of California, Berkeley]] の研究者を中心とした LLM 研究グループ。[[Chatbot Arena]](LLM 評価プラットフォーム)・Vicuna(オープン LLM)・SGLang(LLM 推論フレームワーク)・LMSYS-Chat-1M(大規模会話データセット)等を開発・公開している。[[Ion Stoica]] 教授の研究室を中核として、[[Wei-Lin Chiang]]・[[Lianmin Zheng]] らが中心メンバー。
(Source: [[@2024__arXiv__Chatbot Arena - An Open Platform for Evaluating LLMs by Human Preference]])
SGLang チームは 2025-05-05、[[DeepSeek-V3]] 級モデルを 96 台の H100 GPU 上で PD Disaggregation + 大規模 Expert Parallelism により配備し、DeepSeek 公式プロフィールにほぼ匹敵する性能をオープンソース実装として初めて達成したと報告している。(Source: [[@2025__LMSYS Blog__Deploying DeepSeek with PD Disaggregation and Large-Scale Expert Parallelism on 96 H100 GPUs]])
2026-04-10、Zhiqiang Xie・Zhangheng Huang・Tingwei Huang は前作 HiCache に続く HiSparse を発表した。[[SGLang]] の top-k [[スパース注意]]で不活性な KV キャッシュエントリをホストメモリへ退避しつつ GPU HBM 上に hot device buffer を維持する階層メモリ設計により、並行数256でベースライン比3倍超、長文脈シナリオで最大5倍のスループット改善を報告している。(Source: [[@2026__LMSYS Blog__HiSparse - Turbocharging Sparse Attention with Hierarchical Memory]])