# Pareto フロンティア
コスト(推論費用・ロールアウト時間)と性能(解決率)の2軸で見たとき、ある訓練予算のもとで到達可能な「これ以上コストを増やさずには性能を上げられない」点の集合を指す。エージェント型コーディングモデルは通常、medium/high/max のように複数のエフォートレベル(推論に費やすトークン量・ツール呼び出し数)を持ち、各エフォートレベルがこの平面上の1点に対応する。モデル訓練の目標を「特定のエフォートレベルの性能を上げること」ではなく「フロンティア全体を形状を保ったまま押し上げること」に置き直すのが、この概念のもとになる問題設定である(Source: [[@2026__Cognition__SWE-2 - Pushing the Pareto Frontier]])。
## Pareto最適コスト報酬によるRL
[[Cognition]] は [[SWE-2]] の訓練で、全エフォートレベルを単一の RL run で end-to-end に訓練しつつフロンティア全体を押し上げる手法として、コストペナルティ付き報酬
R = S − λₑC
を導入した。S ∈ {0,1} はロールアウトの成功可否、C はロールアウトコスト(推論費用とロールアウト時間の混合)、e はエフォートレベル、λₑ はエフォートレベル e ごとのペナルティ係数である。
- **線形ペナルティである理由**: 報酬の期待値が「タスク分布全体の平均コストと平均解決率」だけに依存する(=分布の詳細によらない)ことを要求すると、コストと成功可否に対して線形な(アフィンな)報酬しかその条件を満たさないことが Jensen の関数方程式から導かれる。コストと成功可否の同時分布がどのようなものであれ、平均を取る前に報酬を計算しても後に計算しても結果が一致するという条件が、線形性を強制する。
- **λₑ の選び方**: λₑ をハイパーパラメータとして探索するのではなく、ベースモデルの現在の Pareto フロンティアにおけるエフォートレベル e の点での局所勾配 m に一致させる(λₑ = m)。等報酬線(iso-reward line)はスロープ λₑ を持つため、λₑ = m のとき等報酬線はフロンティアに接し、報酬を増やす更新は必ずフロンティア自体を押し上げる方向と一致する。
- **λₑ を大きく取りすぎた場合の失敗モード**: 例えば high エフォートに対して λ_high を過大に設定すると、high エフォートが medium エフォート相当まで手を抜く(コストを大きく削るが解決率もそれなりに落ちる)更新が、コスト削減の効果が解決率低下を上回るために報酬を増やしてしまう。この更新はフロンティアを改善しない「不健全な」報酬の増加であり、モデルが単に安く振る舞うことを学習するだけに終わる。
## 未編纂の観察
## 未解決の問い
- Pareto最適コスト報酬(R=S-λₑC、λₑ=フロンティア局所勾配)は SWE-2 以外のドメイン(コーディング以外のエージェントタスク、マルチモーダルタスク)の複数エフォートレベル訓練にも一般化できるか。局所勾配 m の推定は訓練中のフロンティアの動的な変化にどこまで追従できるか。
## 関連
- 概念: [[検証可能報酬による強化学習]] / [[強化学習スケーリング]]
## 出典
- [[@2026__Cognition__SWE-2 - Pushing the Pareto Frontier]]