# LightLLM ## 概要 オープンソースの GPU ベース LLM サービングシステム。テンソル並列(TP)とイテレーションレベルスケジューリングに対応し、初回フェーズは Flash attention、逐次フェーズはトークン単位の KV キャッシュ管理を行う Token attention カーネルを用いる。優先最適化目標はスループット(Tpt)。 [[vLLM]] の Paged Attention(ブロック単位の KV キャッシュ)をさらに細粒度化したフォローアップアプローチとして位置づけられる。ただし、細粒度化はオーバーヘッドを増大させ、他の最適化(バッチサイズ拡大)と組み合わせると純増分のスループット改善効果が限定的になり、レイテンシを増大させうるという指摘が本サーベイの §3.2.3 でなされている。 ## 関連 - [[vLLM]](Paged Attention の元祖、LightLLM はこれをトークン単位まで細粒度化) - [[KVキャッシュ管理]] - [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 3.2 Taxonomy - System Optimization]] - [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 4 Software Frameworks]] ## 出典 - Xupeng Miao et al., "Towards Efficient Generative Large Language Model Serving: A Survey from Algorithms to Systems", *ACM Computing Surveys* 58(1):15, 2025, §3.2.3, §4, Table 2.