# Dynamic Accelerator Slicer
[[Red Hat]] が開発する [[Red Hat OpenShift]] 向けオペレータで、NVIDIA MIG(Multi-Instance GPU)スライスをワークロード要求に応じて just-in-time に生成・破棄する。静的な事前スライシングによるリソース断片化や、ノード初期化時の静的割当がワークロード変化時にサービス中断を招く問題に対処する。(Source: [[@2026__ICPE__Evaluating Kubernetes Performance for GenAI Inference]])
- 4 つの課題に対応する: (1) 新規ジョブへの即時スライス提供、(2) ワークロード変化に応じた動的な割当・回収、(3) NVIDIA GPU Operator と連携した正確なデバイス構成の公開、(4) スケジューリングとスライス割当のバインディング(Pod は provisioning 成功後にのみ物理 GPU スライスを受け取る)。
- Whisper 転写ジョブへの適用実験(medium モデル: `1g.5gb` スライス、large モデル: `3g.20gb` スライス)では、限定同時実行数(8 ジョブ)固定時は MIG スライス使用によりジョブ完了時間がわずかに悪化した(平均 14→17 分、GPU 利用率 45%→19%)一方、DAS により同時実行ジョブ数を GPU 数(8)からスライス数(25)へ増やすと、平均ジョブ完了時間は 28→18 分(36% 削減)に改善した。これは並列度向上による待ち時間削減効果がスライスあたりの実行時間劣化を上回ったためである。(Source: [[@2026__ICPE__Evaluating Kubernetes Performance for GenAI Inference]])
- 執筆時点で [[Kueue]] との統合(GPU メモリを拡張リソースとして公開し、Kueue がクォータ・admission 制御を、DAS が MIG スライス割当を担う)は開発中(GitHub PR #910)であり、本評価では両者は個別に評価されている。
## 関連
- 本ソース: [[@2026__ICPE__Evaluating Kubernetes Performance for GenAI Inference]]
- 関連システム: [[Red Hat]] / [[Red Hat OpenShift]] / [[Kueue]]
- 関連概念: [[GPUクラスタスケジューリング]]