# Mooncake
Navigation: [[entities/_index]] | [[index]]
## 概要
[[Moonshot AI]] が開発した LLM サービングプラットフォーム。[[Kimi]] の本番サービング基盤として運用中。主要技術報告は [[@2024__arXiv__Mooncake - A KVCache-centric Disaggregated Architecture for LLM Serving]](Qin+ arXiv 2407.00079)。
### サービングプラットフォームとして(2024 論文)
KVCache 中心の分散アーキテクチャで、Prefill Pool・KVCache Pool・Decoding Pool の 3 プールを分離する:
- **Conductor**: グローバルスケジューラ。KVCache 分布とワークロードに基づいてリクエストをディスパッチし、ホットブロック複製・KVCache スワップを担当
- **分散 KVCache プール**: GPU クラスタの CPU/DRAM/SSD を活用した大容量プレフィックスキャッシュ。ブロックハッシュによる前置キャッシュ照合
- **Messenger**: 各ノードに常駐する RDMA ベース KVCache 転送プロセス(GPUDirect RDMA)
- **Chunked Pipeline Parallelism(CPP)**: 長コンテキスト Prefill の複数ノード並列化。SP より少ない通信
- **Layer-wise Prefill**: KVCache ロード/ストアを計算と非同期重畳し VRAM 占有を最小化
- **過負荷指向スケジューリング**: Early Rejection + 予測ベース拒否で GPU 資源の無駄を削減
主要結果: 実ワークロードで vLLM[20M] 比 75% 多いリクエストを SLO 内処理。長コンテキスト模擬データで最大 525% スループット改善。([[@2024__arXiv__Mooncake - A KVCache-centric Disaggregated Architecture for LLM Serving]])
### KVCache Storage Engine として(Kimi K1.5 / SpeakerDeck)
[[Kimi K1.5]] の RL インフラストラクチャにおいて、[[Megatron-LM]] から [[vLLM]] へのノード間重み転送に使用される。Pipeline Parallelism・Expert Parallelism を Tensor Parallelism のみに変換したチェックポイントを共有メモリ経由でシャード化し、RDMA でピアノード間を転送する。([[@2025__arXiv__Kimi K1.5 - Scaling Reinforcement Learning with LLMs]])
Mooncake Store として独立したサービスでも動作し、[[LMCache]] と組み合わせた KV Cache Reuse/Sharing も実証されている。入力 8k で KV Cache Reuse が TTFT を最大 1.75 倍削減。([[@2026__SpeakerDeck__推論基盤のパフォーマンス検証と最適化戦略]])
## 関連
- [[Kimi K1.5]] — RL インフラでの使用先
- [[Moonshot AI]] — 開発元
- [[vLLM]] — 連携推論フレームワーク
- [[Megatron-LM]] — RL 訓練フレームワーク(重み転送元)
- [[LMCache]] — KV Cache Reuse/Sharing での連携
- [[Prefill-Decode分離]] — アーキテクチャのコア設計
- [[KVキャッシュ管理]] — 分散 KVCache プールの概念的位置づけ
## 出典
- [[@2024__arXiv__Mooncake - A KVCache-centric Disaggregated Architecture for LLM Serving]]
- [[@2025__arXiv__Kimi K1.5 - Scaling Reinforcement Learning with LLMs]]
- [[@2026__SpeakerDeck__推論基盤のパフォーマンス検証と最適化戦略]]