# DynamoServe HPE Labs・Georgia Tech・University of Utah・UC Riverside の共同研究による、マルチテナント LLM サービング向け分散階層メモリシステム。NVLink 接続ドメイン内の遊休 GPU HBM をクラスタ横断リソースとしてプールし、モデル重みと KV キャッシュをピア GPU へ透明にオフロードする。集中型コントローラがメモリ階層(ローカル GPU・ピア GPU・CPU・NVMe)への配置を決定し、各 GPU 上のオフロードエンジン(OE)が GPU 間直接転送を実行する。(Source: [[@2026__SIGCOMM__DynamoServe - A Distributed Tiered Memory System for Multi-tenant LLM Serving]]) FlexGen と vLLM 上に OE を実装したプロトタイプが 8×V100 クラスタで評価され、単一 GPU 容量を超える OPT-30B 推論で FlexGen・Aqua 比 2 倍以上のトークンスループットを示す。(Source: [[@2026__SIGCOMM__DynamoServe - A Distributed Tiered Memory System for Multi-tenant LLM Serving]]) ## 関連 - ソース: [[@2026__SIGCOMM__DynamoServe - A Distributed Tiered Memory System for Multi-tenant LLM Serving]] - 比較対象: [[FlexGen]] / [[vLLM]] - 所属: [[Hewlett Packard Labs]] / [[Georgia Institute of Technology]]