# Sarathi-Serve
Amey Agrawal ら([[Microsoft Research]] India、USENIX OSDI 2024)が提案した LLM 推論サービングシステムで、chunked-prefill(プリフィルを固定サイズのチャンクに分割し、進行中の decode を止めずにバッチへ混在させる技術)と stall-free batching により、スループットとレイテンシのトレードオフを緩和する。[[vLLM]] の PagedAttention・テンソル並列基盤上に構築される。(Source: [[@2025__arXiv__Niyama - Breaking the Silos of LLM Inference Serving]])
固定チャンクサイズと FCFS(到着順)を前提とするため、複数 QoS クラスを co-schedule する場合は最も厳格な SLO に合わせて小さいチャンクサイズを選ばざるを得ず、スループットが低下する(論文中では固定チャンクサイズ 330 で 50ms TBT SLO を満たすとスループットが 28% 低下する例が示される)。[[@2025__arXiv__Niyama - Breaking the Silos of LLM Inference Serving|Niyama]] はこの Sarathi-Serve のスケジューラコンポーネントを拡張し、動的チャンキング・ハイブリッド優先度付け・積極的降格を追加することで、複数 QoS クラスの co-scheduling を可能にした。(Source: [[@2025__arXiv__Niyama - Breaking the Silos of LLM Inference Serving]])
## 関連
- ソース: [[@2025__arXiv__Niyama - Breaking the Silos of LLM Inference Serving]]
- 拡張先: [[@2025__arXiv__Niyama - Breaking the Silos of LLM Inference Serving|Niyama]]
- 基盤: [[vLLM]]
- 開発元: [[Microsoft Research]]