# KVBM (KV Block Manager) KVBM(KV Block Manager)は、[[NVIDIA Dynamo]] の構成要素として提供される、異種・分散環境をまたいで推論タスク向け KV ブロックのメモリ割り当て・管理・リモート共有を担うスケーラブルなランタイムコンポーネントである。[[vLLM]] や [[TensorRT-LLM]] のようなフレームワークに対する統合メモリ層・write-through キャッシュとして機能する。(Source: [[@2026__NVIDIADynamoDocs__KVBM (KV Block Manager) 概要]]) > [!note] NVIDIA Dynamo エンティティページとの関係 > [[NVIDIA Dynamo]] ページの「主要コンポーネント」節では本コンポーネントを簡潔に「KV Cache Block Manager」と紹介しているが、本ページはその詳細版として公式ドキュメント KVBM Overview の内容を集約する。 ## 3層アーキテクチャ KVBM は3つの論理層で構成される。 1. **LLM 推論ランタイム層(最上層)**: [[TensorRT-LLM]]・[[vLLM]] などの推論ランタイムが、専用コネクタモジュールを介して KVBM と統合する。コネクタはランタイム固有の操作・イベントを KVBM のブロック指向メモリインターフェースへ写像する翻訳層であり、メモリ管理を推論ランタイムから分離してバックエンド可搬性とメモリ階層化を可能にする。 2. **KVBM ロジック層(中間層)**: KV ブロック管理の中核ロジック。KVBM アダプタが異なるランタイムからのリクエスト表現・データレイアウトを正規化し、テーブルルックアップ、メモリ割り当て、ブロックレイアウト管理、生存周期(allocate → register → match のイベントベース状態遷移)、ブロック再利用/エビクションポリシーを実装する。 3. **[[NIXL]] 層(最下層)**: すべてのデータ・ストレージ取引の統一サポート。P2P GPU 転送、RDMA・NVLink 経由のリモートメモリ共有、動的ブロック登録とメタデータ交換を可能にし、GPU HBM・Host DRAM・Remote DRAM・Local SSD といったブロックメモリからローカル/リモートファイルシステム・オブジェクトストア・クラウドストレージまでを繋ぐストレージバックエンドへのプラグインインターフェースを提供する。 (Source: [[@2026__NVIDIADynamoDocs__KVBM (KV Block Manager) 概要]]) ## サポート状況 | 分類 | 項目 | 対応 | |---|---|---| | Backend | Local / Kubernetes | ✅ / ✅ | | LLM Framework | vLLM / TensorRT-LLM | ✅ / ✅ | | LLM Framework | SGLang | ❌ | | Serving Type | Aggregated / Disaggregated | ✅ / ✅ | [[SGLang]] は KVBM に対応せず、代わりに自身の階層キャッシュ機構 HiCache を NIXL と直接連携させる別経路を持つ(公式ドキュメントの SGLang HiCache ページで案内、本 wiki は未取り込み)。KVBM は「推論ランタイム非依存の共通メモリ管理層」を志向する一方、SGLang はエンジン内蔵の階層キャッシュ実装を選ぶという設計判断の違いがある。(Source: [[@2026__NVIDIADynamoDocs__KVBM (KV Block Manager) 概要]]) ## KV キャッシュオフロードのユースケース 長期セッション・マルチターン会話でのプレフィックス保持、高並行性下でのアイドルリクエスト退避、システムプロンプト等の共有・反復コンテンツの再利用、メモリ・コスト制約環境での GPU 需要削減という4つの典型シナリオが挙げられている。(Source: [[@2026__NVIDIADynamoDocs__KVBM (KV Block Manager) 概要]]) ## 他システムとの位置づけ 公式ドキュメントは KV Cache Offloading の比較ページ(未取り込み)で KVBM を [[LMCache]]・FlexKV・HiCache と並べて比較すると案内している。KVBM は NVIDIA Dynamo にネイティブ統合された「フレームワーク非依存の統一メモリ層 + [[NIXL]] によるハードウェア直結転送」という設計であり、LMCache が vLLM の KV connector 経由で GPU 外階層キャッシュを提供する設計([[KVキャッシュ管理]] 参照)と対比できる。両者の詳細な機能差分は比較ページ未取り込みのため今後の課題とする。 ## 関連 - ソース: [[@2026__NVIDIADynamoDocs__KVBM (KV Block Manager) 概要]] - 親コンポーネント: [[NVIDIA Dynamo]] - 転送層: [[NIXL]] - 概念: [[KVキャッシュ管理]] - 対応フレームワーク: [[vLLM]] / [[TensorRT-LLM]] - 非対応・代替: [[SGLang]](HiCache + NIXL 直接連携) - 比較対象(未取り込み): [[LMCache]] / FlexKV / HiCache - 公式: https://docs.nvidia.com/dynamo/dev/knowledge-base/modular-components/kvbm/overview