# FlexFlow-Serve
## 概要
Carnegie Mellon University が開発したオープンソース GPU ベース LLM サービングシステム。テンソル並列(TP)・パイプライン並列(PP)・オフロード・イテレーションレベルスケジューリングをすべてサポートする。初回フェーズは cuBLAS GEMM、逐次フェーズは木構造のアテンション(Tree attention)カーネルを用いる。
最大の特徴は SpecInfer による投機的デコーディングで、複数の小モデル・異なるビーム・並列サンプリングから得た投機トークンをゼロメモリ冗長・最大スレッド並列で検証する。これにより極めて低いレイテンシ(Lat)を優先目標として実現する。[[vLLM]] がスループット(Tpt)優先で Paged Attention を採用するのと対比される代表例として言及される。
## 関連
- [[vLLM]]
- [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 4 Software Frameworks]]
## 出典
- Xupeng Miao et al., "Towards Efficient Generative Large Language Model Serving: A Survey from Algorithms to Systems", *ACM Computing Surveys* 58(1):15, 2025, §4, Table 2.