# JetStream Google がオープンソース化した LLM 推論サービングライブラリ([GitHub](https://github.com/google/JetStream))。prefill engine と generate engine を別 TPU スライス上に置き、単一コントローラで orchestrate する。prefill thread・generate thread・KV キャッシュ転送を担う transfer thread の 3 スレッドで構成され、任意の LLM が実装すべき Engine インターフェースは `prefill`(トークン列から KV キャッシュを生成)・`insert`(KV キャッシュを generate 中のバッチへ挿入)・`generate`(バッチ化された KV キャッシュから 1 トークンずつ生成)の 3 メソッドを持つ。PyTorch 版の [jetstream-pytorch](https://github.com/google/jetstream-pytorch) も存在する。(Source: [[@2025__ScalingBook__How to Scale Your Model - Part 7 Inference]]) ## 関連 - 概念: [[Prefill-Decode分離]]