# ZeRO-Inference ## 概要 [[DeepSpeed]] 系列のオープンソース GPU ベース LLM サービングシステム。テンソル並列(TP)・パイプライン並列(PP)・オフロードをサポートするが、イテレーションレベルスケジューリングは持たない。初回・逐次フェーズともに cuBLAS GEMM を用いる。CPU・NVMe へのオフロードを特徴とし、単一 GPU でのスループット(Tpt)最大化を優先目標とする点で、GPU 台数を増やしてマルチノード性能を狙う DeepSpeed-Inference と対比される。 ## 関連 - [[DeepSpeed]] / [[FlexGen]](同様に単一 GPU での Tpt 最大化を狙うオフロード指向システム) - [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 4 Software Frameworks]] ## 出典 - Xupeng Miao et al., "Towards Efficient Generative Large Language Model Serving: A Survey from Algorithms to Systems", *ACM Computing Surveys* 58(1):15, 2025, §4, Table 2.