# llm-d
Kubernetes エコシステムを拡張し LLM 推論ワークロードを効率的にオーケストレーションするフレームワーク(llm-d.ai)。[[Gateway API Inference Extension]](GAIE)の Endpoint Picker (EPP) を実装し、キャッシュ局所性とワークロードテレメトリに基づく「Precise Prefix-Cache Aware Scheduling(well-lit path)」戦略によりルーティングを最適化する。(Source: [[@2026__ICPE__Evaluating Kubernetes Performance for GenAI Inference]])
- Kubernetes GenAI 推論性能評価の産業論文では、8 基の [[vLLM]] レプリカ(Qwen3-8B)を llm-d + GAIE 経由でホストし、Shared Prefix Cache による KV キャッシュ共有を実現する構成(OpenShift Service Mesh の Envoy をゲートウェイとして使用)で評価された。
- transformer ベース LLM の prefill フェーズ(計算コストが高い)で生成される KV キャッシュを decode フェーズが再利用することで冗長計算を避けるが、分散環境で類似プロンプトがキャッシュ非認識のまま異なるレプリカへルーティングされると、各レプリカが同じプレフィックス状態を再計算し GPU サイクルを浪費する。llm-d は GAIE のプログラム可能なスケジューリング層を通じてこの問題に対処する。(Source: [[@2026__ICPE__Evaluating Kubernetes Performance for GenAI Inference]])
- [[IBM Research]](主著者 [[Abhishek Malvankar]] ほか)が、llm-d と共同設計されたオートスケーラ Workload Variant Autoscaler(WVA)を発表した([[@2026__arXiv__WVA - A Global Optimization Control Plane for llmd]]、arXiv 2026)。WVA は llmd の推論サーバー内部飽和状態(KV キャッシュ利用率・キュー長)と密結合した headroom ベースのグローバルオートスケーリングを行い、Kubernetes HPA(資源中心・ハードウェア均質前提)の限界を克服する。llmd のスケジューラ(EPP - endpoint picker)が持つ queue-scorer・kv-cache-utilization-scorer・prefix-cache-scorer によるルーティングヒューリスティクスと、WVA のスケーリング判断をフェーズ整合させる設計を採る。200 基の H100 GPU を持つ実機 OpenShift クラスタ検証で、HPA 比の有効スループット最大 37% 改善・リクエスト失敗数 10 分の 1 を達成した。(Source: [[@2026__arXiv__WVA - A Global Optimization Control Plane for llmd]])
## 関連
- 本ソース: [[@2026__ICPE__Evaluating Kubernetes Performance for GenAI Inference]] / [[@2026__arXiv__WVA - A Global Optimization Control Plane for llmd]]
- 関連システム: [[Gateway API Inference Extension]] / [[vLLM]] / [[Qwen3]]
- 関連組織: [[IBM Research]]
- 関連概念: [[KVキャッシュ管理]] / [[オートスケーリング]] / [[LLMサービング管理]]