# FlexGen
Ying Sheng ら(ICML 2023)による、単一 GPU で大規模 LLM 生成推論を行うためのオフロードシステム。LLM 状態を CPU DRAM や NVMe へ退避して実効容量を拡張するが、インターコネクト帯域制約によりデータ移動オーバーヘッドが大きい。(Source: [[@2026__SIGCOMM__DynamoServe - A Distributed Tiered Memory System for Multi-tenant LLM Serving]])
DynamoServe 論文では、FlexGen をベースラインの一つとし、単一ノード・動的メモリ管理なしという制約を指摘したうえで、ピア GPU メモリオフロード拡張を実装して比較している。OPT-30B のピア GPU オフロード実験では、DynamoServe が FlexGen より大幅に低レイテンシ・高スループットを達成する。(Source: [[@2026__SIGCOMM__DynamoServe - A Distributed Tiered Memory System for Multi-tenant LLM Serving]])
## 関連
- ソース: [[@2026__SIGCOMM__DynamoServe - A Distributed Tiered Memory System for Multi-tenant LLM Serving]]
- 比較: [[DynamoServe]] / [[Aqua]]