# Whisper
OpenAI が開発した自動音声認識(ASR)モデル。複数のモデルサイズ(medium: 769M パラメータ、large: 1550M パラメータ等)で提供される。(Source: [[@2026__ICPE__Evaluating Kubernetes Performance for GenAI Inference]])
- Kubernetes GenAI 推論性能評価の産業論文では、[[Earnings-22]] データセットの企業決算説明会音声を Whisper medium/large モデルで転写するバッチジョブとして、[[Kueue]] のスケジューリング評価および Dynamic Accelerator Slicer(DAS)の GPU スライシング評価の両方のワークロードに使われた。
- large モデルは medium モデルより高い転写精度を持つが、計算複雑度と処理時間が増加する。ジョブランタイムはモデルバリアントと入力音声長の両方に依存する(例: medium モデルで長い音声ファイルを処理する方が、large モデルで短い音声ファイルを処理するより長くかかる場合がある)。(Source: [[@2026__ICPE__Evaluating Kubernetes Performance for GenAI Inference]])
## 関連
- 本ソース: [[@2026__ICPE__Evaluating Kubernetes Performance for GenAI Inference]]
- 関連システム: [[Kueue]] / [[Dynamic Accelerator Slicer]]
- 関連データセット: [[Earnings-22]]