# MLC-LLM ## 概要 オープンソースの GPU ベース LLM サービングシステム。テンソル並列(TP)とイテレーションレベルスケジューリングに対応し、初回フェーズはコンパイルされた MatMul カーネル、逐次フェーズは Paged attention を用いる。カーネルは TVM が生成する。 特徴はユニバーサルデプロイと複数種の GPU への対応であり、優先最適化目標はレイテンシ(Lat)。自動コンパイル(TVM・MLIR・JAX・OpenAI Triton 等)を実運用システムに組み込んだ代表例として §3.2.5 でも参照される。 ## 関連 - [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 3.2 Taxonomy - System Optimization]] - [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 4 Software Frameworks]] ## 出典 - Xupeng Miao et al., "Towards Efficient Generative Large Language Model Serving: A Survey from Algorithms to Systems", *ACM Computing Surveys* 58(1):15, 2025, §4, Table 2.