# ZeRO-Inference
## 概要
[[DeepSpeed]] 系列のオープンソース GPU ベース LLM サービングシステム。テンソル並列(TP)・パイプライン並列(PP)・オフロードをサポートするが、イテレーションレベルスケジューリングは持たない。初回・逐次フェーズともに cuBLAS GEMM を用いる。CPU・NVMe へのオフロードを特徴とし、単一 GPU でのスループット(Tpt)最大化を優先目標とする点で、GPU 台数を増やしてマルチノード性能を狙う DeepSpeed-Inference と対比される。
## 関連
- [[DeepSpeed]] / [[FlexGen]](同様に単一 GPU での Tpt 最大化を狙うオフロード指向システム)
- [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 4 Software Frameworks]]
## 出典
- Xupeng Miao et al., "Towards Efficient Generative Large Language Model Serving: A Survey from Algorithms to Systems", *ACM Computing Surveys* 58(1):15, 2025, §4, Table 2.