## 定義
決定志向予測評価は、予測モデルを点予測誤差(MASE・RMSE等)ではなく、その予測が駆動する下流の意思決定の結果で評価する枠組みである。運用テレメトリでは点予測誤差が単純な last-value ベースラインに近い水準で頭打ちになりやすく、誤差の改善が下流の意思決定(スケジューリング・キャパシティプロビジョニング等)の改善を保証しない。決定再生(decision replay)は、記録された意思決定プロセス(スケジューリング・プロビジョニング等)を再実行し、評価対象モデルが供する推定値だけをデプロイ済みの値に置き換え、到着・真の値・その他の条件は固定してスコアリングする具体的な評価プロトコルである。(Source: [[@2026__arXiv__Centile - A Telemetry Foundation Model Evaluated by the Decisions It Drives]])
## 横断的知見
- (2ソース目以降に蓄積する。現時点では単一ソースのため、定義に記載した内容のみ。)
## 未解決の問い
- 決定志向評価がキャリブレーション(分位点が名目カバレッジを満たすこと)を前提とする場合、キャリブレーションが崩れた場合に決定再生の結果がどの程度悪化するか、感度は定量化されているか。
- [[時系列基盤モデル]]の一般的な評価(MASE・CRPS等)と決定志向評価(bounded slowdown・違反率等)が乖離する具体例は Centile 論文のバックフィリング実験(真のランタイムでのスケジューリングが最適でない)以外にも存在するか。他ドメイン(推薦システム・広告配信等)の decision-focused learning 文献との接続は未整理。
## 関連
- [[@2026__arXiv__Centile - A Telemetry Foundation Model Evaluated by the Decisions It Drives]] — バックフィリングとネットワークプロビジョニングの2つの意思決定で決定志向評価を実施し、点予測メトリクスが隠す差異を暴露した
- [[時系列基盤モデル]] — 汎用時系列基盤モデルは主に点予測誤差(MASE等)で評価される。決定志向評価はこれに対する批判・補完となる評価軸
- [[HPCジョブスケジューリング]] — 決定志向評価の対象となる代表的な意思決定の1つ
## 出典
- [[@2026__arXiv__Centile - A Telemetry Foundation Model Evaluated by the Decisions It Drives]]