# Goodput
## 定義
goodput(有用スループット)は、GPU・TPUなどのクラスタが持つ理論上のハードウェア最大性能(NVIDIAはこれを"speed of light"と呼ぶ)に対して、実際に学習・推論という有用な処理に変換されたスループットの比率を測る指標である。FLOPSやデバイス利用率のような従来指標は、通信の停滞・計算のアイドル・ジョブ再起動の失敗に費やされた時間を含んでしまうため見かけ上高くなりやすく、実態の効率を過大評価する。goodputは、単位時間あたりに処理されたトークン数や完了した推論リクエスト数のうち、モデルの学習・推論に直接貢献しない時間を差し引いた値として定義され、クラスタの理論最大スループットで正規化することで効率(%)として表現できる。(Source: [[@2025__OReilly__AI Systems Performance Engineering - Chapter 1 Introduction and AI System Overview]])
例として、8GPUノードが10秒間に100,000トークンを処理する場合、達成goodputは10,000トークン/秒である。各GPUのピーク理論スループットが1,500トークン/秒(8GPU合計12,000トークン/秒)であれば、ノードの効率は83.3%(10,000/12,000)となる。Metaのインフラチームは論文「Revisiting Reliability」でeffective training time ratioという指標を提示し、見かけ上100%利用率のクラスタでも、プリエンプション・リソース断片化・ネットワーク輻輳・障害復旧により70〜75%の計算が実質的に失われうることを示した。(Source: [[@2025__OReilly__AI Systems Performance Engineering - Chapter 1 Introduction and AI System Overview]])
## 横断的知見
- **TPUフリート向けMPGとの分解粒度の違い**: [[ML Productivity Goodput]](MPG)はGoogleのTPUフリートを対象に、goodputを「スケジューリング(SG)×ランタイム(RG)×プログラム(PG)」の3成分に分解し、各層の改善余地を切り分ける設計を持つ。一方、本ソースが紹介するgoodputはGPUクラスタ全般を対象とする、より単純な「達成/理論ピーク」の単一比率であり、MetaのRevisiting Reliability論文が示す70〜75%の損失の内訳(プリエンプション・輻輳・障害復旧)はMPGのRG・SGに相当する要因と重なる。両者は同じ問題意識(見かけの利用率は実効効率を過大評価する)を異なる粒度で定式化したものと位置づけられる。(Source: [[@2025__OReilly__AI Systems Performance Engineering - Chapter 1 Introduction and AI System Overview]], [[ML Productivity Goodput]])
- MPGがTPU/Borg固有の3層分解にこだわるのに対し、本ソースのgoodputはGPUクラスタでの実務的な目安(例: 83.3%の効率)としてシンプルに使われており、汎用的な「対外説明用の一枚指標」としての役割が強いことがうかがえる。(Source: [[@2025__OReilly__AI Systems Performance Engineering - Chapter 1 Introduction and AI System Overview]])
## 未解決の問い
- 本ソースのgoodput定義とMPGの3成分分解(SG×RG×PG)を統一的なフレームワークとして対応づけられるか。特にMPGのSG(スケジューリング効率)に相当する要因が本ソースの単純比率にどう埋め込まれているかは未整理。
- GPUクラスタ(NCCL・Kubernetes等)におけるgoodput計測の標準的なツール・実装は本章では言及されていない。第2章以降やMLPerf関連ソースでの追跡が必要。
- goodput向上の実例として挙げられた「20%のクラスタ効率向上が数百万ドルのハードウェアコスト削減につながる」という主張の定量的根拠(具体的な計算)は本章では示されていない。
## 関連
- ソース: [[@2025__OReilly__AI Systems Performance Engineering - Chapter 1 Introduction and AI System Overview]]
- 概念: [[ML Productivity Goodput]](TPUフリート向けの3成分分解版)
- エンティティ: [[wiki/entities/AI Systems Performance Engineering|AI Systems Performance Engineering]] / [[Meta]] / [[NVIDIA]]
## 出典
- Chris Fregly, *AI Systems Performance Engineering*, O'Reilly Media, 2025, Chapter 1.