# Sarathi-Serve Amey Agrawal ら([[Microsoft Research]] India、USENIX OSDI 2024)が提案した LLM 推論サービングシステムで、chunked-prefill(プリフィルを固定サイズのチャンクに分割し、進行中の decode を止めずにバッチへ混在させる技術)と stall-free batching により、スループットとレイテンシのトレードオフを緩和する。[[vLLM]] の PagedAttention・テンソル並列基盤上に構築される。(Source: [[@2025__arXiv__Niyama - Breaking the Silos of LLM Inference Serving]]) 固定チャンクサイズと FCFS(到着順)を前提とするため、複数 QoS クラスを co-schedule する場合は最も厳格な SLO に合わせて小さいチャンクサイズを選ばざるを得ず、スループットが低下する(論文中では固定チャンクサイズ 330 で 50ms TBT SLO を満たすとスループットが 28% 低下する例が示される)。[[@2025__arXiv__Niyama - Breaking the Silos of LLM Inference Serving|Niyama]] はこの Sarathi-Serve のスケジューラコンポーネントを拡張し、動的チャンキング・ハイブリッド優先度付け・積極的降格を追加することで、複数 QoS クラスの co-scheduling を可能にした。(Source: [[@2025__arXiv__Niyama - Breaking the Silos of LLM Inference Serving]]) ## 関連 - ソース: [[@2025__arXiv__Niyama - Breaking the Silos of LLM Inference Serving]] - 拡張先: [[@2025__arXiv__Niyama - Breaking the Silos of LLM Inference Serving|Niyama]] - 基盤: [[vLLM]] - 開発元: [[Microsoft Research]]