# MLC-LLM
## 概要
オープンソースの GPU ベース LLM サービングシステム。テンソル並列(TP)とイテレーションレベルスケジューリングに対応し、初回フェーズはコンパイルされた MatMul カーネル、逐次フェーズは Paged attention を用いる。カーネルは TVM が生成する。
特徴はユニバーサルデプロイと複数種の GPU への対応であり、優先最適化目標はレイテンシ(Lat)。自動コンパイル(TVM・MLIR・JAX・OpenAI Triton 等)を実運用システムに組み込んだ代表例として §3.2.5 でも参照される。
## 関連
- [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 3.2 Taxonomy - System Optimization]]
- [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 4 Software Frameworks]]
## 出典
- Xupeng Miao et al., "Towards Efficient Generative Large Language Model Serving: A Survey from Algorithms to Systems", *ACM Computing Surveys* 58(1):15, 2025, §4, Table 2.