# Mooncake Navigation: [[entities/_index]] | [[index]] ## 概要 [[Moonshot AI]] が開発した LLM サービングプラットフォーム。[[Kimi]] の本番サービング基盤として運用中。主要技術報告は [[@2024__arXiv__Mooncake - A KVCache-centric Disaggregated Architecture for LLM Serving]](Qin+ arXiv 2407.00079)。 ### サービングプラットフォームとして(2024 論文) KVCache 中心の分散アーキテクチャで、Prefill Pool・KVCache Pool・Decoding Pool の 3 プールを分離する: - **Conductor**: グローバルスケジューラ。KVCache 分布とワークロードに基づいてリクエストをディスパッチし、ホットブロック複製・KVCache スワップを担当 - **分散 KVCache プール**: GPU クラスタの CPU/DRAM/SSD を活用した大容量プレフィックスキャッシュ。ブロックハッシュによる前置キャッシュ照合 - **Messenger**: 各ノードに常駐する RDMA ベース KVCache 転送プロセス(GPUDirect RDMA) - **Chunked Pipeline Parallelism(CPP)**: 長コンテキスト Prefill の複数ノード並列化。SP より少ない通信 - **Layer-wise Prefill**: KVCache ロード/ストアを計算と非同期重畳し VRAM 占有を最小化 - **過負荷指向スケジューリング**: Early Rejection + 予測ベース拒否で GPU 資源の無駄を削減 主要結果: 実ワークロードで vLLM[20M] 比 75% 多いリクエストを SLO 内処理。長コンテキスト模擬データで最大 525% スループット改善。([[@2024__arXiv__Mooncake - A KVCache-centric Disaggregated Architecture for LLM Serving]]) ### KVCache Storage Engine として(Kimi K1.5 / SpeakerDeck) [[Kimi K1.5]] の RL インフラストラクチャにおいて、[[Megatron-LM]] から [[vLLM]] へのノード間重み転送に使用される。Pipeline Parallelism・Expert Parallelism を Tensor Parallelism のみに変換したチェックポイントを共有メモリ経由でシャード化し、RDMA でピアノード間を転送する。([[@2025__arXiv__Kimi K1.5 - Scaling Reinforcement Learning with LLMs]]) Mooncake Store として独立したサービスでも動作し、[[LMCache]] と組み合わせた KV Cache Reuse/Sharing も実証されている。入力 8k で KV Cache Reuse が TTFT を最大 1.75 倍削減。([[@2026__SpeakerDeck__推論基盤のパフォーマンス検証と最適化戦略]]) ## 関連 - [[Kimi K1.5]] — RL インフラでの使用先 - [[Moonshot AI]] — 開発元 - [[vLLM]] — 連携推論フレームワーク - [[Megatron-LM]] — RL 訓練フレームワーク(重み転送元) - [[LMCache]] — KV Cache Reuse/Sharing での連携 - [[Prefill-Decode分離]] — アーキテクチャのコア設計 - [[KVキャッシュ管理]] — 分散 KVCache プールの概念的位置づけ ## 出典 - [[@2024__arXiv__Mooncake - A KVCache-centric Disaggregated Architecture for LLM Serving]] - [[@2025__arXiv__Kimi K1.5 - Scaling Reinforcement Learning with LLMs]] - [[@2026__SpeakerDeck__推論基盤のパフォーマンス検証と最適化戦略]]