# Kueue
[kubernetes-sigs/kueue](https://github.com/kubernetes-sigs/kueue) は、Kubernetes クラスタ上で Job・JobSet・LeaderWorkerSet・MPIJob 等の複数ワークロード種別を対象に、ClusterQueue によるクォータ管理と admission 制御を行うバッチジョブキューイングコントローラである。kube-scheduler そのものを置き換えるのではなく、その手前で「いつ・どれだけの Workload を admission するか」を決定する層として動作する。(Source: [[@2024__KEP__KEP-2724 Topology Aware Scheduling]])
- Kueue の設計拡張は独自の KEP(Kubernetes Enhancement Proposal)フォーマットをリポジトリ内 `keps/` に持ち、Kubernetes コア本体の KEP プロセス(例: [[@2024__KEP__KEP-4381 Dynamic Resource Allocation with Structured Parameters]])とは別系統で運用されている。
- [[トポロジ考慮型スケジューリング]](TAS)は Kueue の主要拡張の一つで、データセンターのラック・ブロック階層をノードラベルとして表現し、AI/ML ワークロードの Pod 間通信帯域を意識した配置制約(required/preferred/unconstrained)を ResourceFlavor・PodTemplate アノテーション経由で表現する。2024-07-30 の KEP-2724 提案から 2026-08-19 時点で v0.19 系まで継続的に改訂されている「生きた」機能である。(Source: [[@2024__KEP__KEP-2724 Topology Aware Scheduling]])
- ClusterAutoscaler とは ProvisioningRequest AdmissionCheck を介して統合され、Kueue は quota 予約と実際のノード確保・トポロジ割当を「2 パス」に分離することで、まだ存在しないノードに対する早すぎる割当確定を避ける設計を採る。(Source: [[@2024__KEP__KEP-2724 Topology Aware Scheduling]])
- GenAI 推論パイプライン(Whisper 転写バッチジョブ)への適用実験では、Kueue の優先度クラス(WorkloadPriorityClass)とプリエンプションの組み合わせにより、ベースライン(素の Kubernetes Job)比でメイクスパンを最大 15% 削減した。決定的な admission 順序(medium-N, large-N の交互スケジュール)により、素の Kubernetes スケジューラの非決定的な機会主義的順序より再現性の高い挙動を提供する。admission attempt duration は複数構成で 99 パーセンタイルでも 25ms 未満と、スケジューリングロジック自体のオーバーヘッドは無視できる水準だった。(Source: [[@2026__ICPE__Evaluating Kubernetes Performance for GenAI Inference]])
- KubeCon Amsterdam '23 での発表後、[[Google]] の [[Aldo Culquicondor]] が [[Flux Framework]] を Kubernetes 内で稼働させる「Flux Operator」を Kueue のジョブ種別として統合する作業を主導した。素の Kubernetes Job・[[MPI Operator]] と並ぶ、HPC ワークロードマネージャ向けの新しい統合先として Kueue が選ばれた事例であり、GenAI 推論(上記)とは異なる HPC ワークロード(LAMMPS 等の MPI ジョブ)がターゲットである点で Kueue の適用範囲の広さを示す。(Source: [[@2023__arXiv__The Flux Operator]] §3.6 Workflow Integration)
## 関連
- 本ソース: [[@2024__KEP__KEP-2724 Topology Aware Scheduling]] / [[@2026__ICPE__Evaluating Kubernetes Performance for GenAI Inference]] / [[@2023__arXiv__The Flux Operator]]
- 関連システム: [[Kubernetes]] / [[Flux Framework]] / [[MPI Operator]]
- 関連概念: [[トポロジ考慮型スケジューリング]] / [[GPUクラスタスケジューリング]] / [[Dynamic Resource Allocation (DRA)]] / [[収束コンピューティング]]