# @2026__Cognition__SWE-2 - Pushing the Pareto Frontier
Navigation: [[sources/_index]] | [[index]]
**著者**: [[Cognition]]
**URL**: https://cognition.com/blog/swe-2
**公開**: 2026 年 9 月 10 日
## 要旨
[[Cognition]] が自社最新のエージェント型コーディングモデル [[SWE-2]] を発表したブログ記事。[[Kimi K3]](2.8T パラメータ)をベースに、[[SWE-1.7]] の訓練基盤・レシピを継承しつつ数兆パラメータ規模へ初めて RL をスケールした。核となる新規性は、複数のエフォートレベル(medium/high/max)を単一の RL run 内で同時に訓練し、コスト–性能の Pareto フロンティア全体を形状を保ったまま押し上げる手法である。記事は前半でモデルの行動変化(効率化・焦点を絞った探索・検証規律)を報告し、後半でコストペナルティの理論的導出・長さ加重報酬ベースライン・RL ロールアウト配信の数値最適化・データ改善・信頼性評価という 5 本の技術的柱を解説する。SWE-2 は [[Devin]] Desktop・CLI で提供開始、Web・Fusion へも展開中である。
## ベンチマーク結果
Pass rate (%)。
| ベンチマーク | SWE-2 | Kimi K3 | Grok 4.6 | Fable 5.1 | GPT-5.6 Sol | GPT-6 Astra | SWE-1.7 |
|---|---|---|---|---|---|---|---|
| [[FrontierCode]] 1.1 Main | 50.0% | 44.2% | 48.0% | 50.9% | 47.5% | 53.3% | 42.0% |
| [[DeepSWE]] 1.1 | 73.0% | 68.5% | 67.5% | 67.4% | 72.7% | 74.1% | 37.7% |
| [[Terminal-Bench]] 2.1 | 92.8% | 88.3% | 88.4% | 91.4% | 88.8% | 89.9% | 81.5% |
| Terminal-Bench 4 | 27.3% | 21.5% | 20.3% | 55.8% | 37.3% | 57.9% | 7.6% |
SWE-2 は FrontierCode 1.1 Main・DeepSWE 1.1 の両方でスコア・コストともに SWE-1.7 と Grok 4.6 を上回り、GPT-5.6 Sol・Fable 5.1 に僅差の性能をそれらの数分の1のコストで実現し、GPT-6 Astra には数ポイント差まで肉薄しつつコストは4分の1に留まる。ベースモデルの [[Kimi K3]] に対しても多くのベンチマークで 5〜6 ポイントの上乗せがあり、K3 のコスト–性能フロンティア全体をシフトさせたと報告している(Source: 記事内ベンチマーク表)。Terminal-Bench 4 のみ Fable 5.1・GPT-6 Astra に大差で劣後しており、汎用ターミナル操作の難タスクでは依然ギャップが残る。
## モデル行動: 効率化と焦点を絞った探索
[[SWE-1.7]] は徹底したコードベース探索によって性能を高めた一方、単純なタスクでも過度に探索・思考する傾向がユーザーから指摘されていた。SWE-2 はこの点を明確に改善する。FrontierCode 1.1 Main での平均ステップ数は SWE-1.7 の 127 に対し、SWE-2 medium 53・high 80・max 98。SWE-2 medium が最初の実質的な編集を行うまでの中央値ステップ数は 18 で、SWE-1.7 の 48 から大幅に短縮された。Cognition はこれを「探索量そのものの削減」ではなく「どの部分が本当に重要かを判断する能力の向上による焦点を絞った探索」と分析している。
その他の観測された行動特性:
- **テストカバレッジ**: 実装をエンドツーエンドで検証するテストを書き、リグレッションとエッジケースをより確実に検出する。
- **境界内での資質性**: 明白な経路が塞がれている場合、別経路を探す。例として、必要な MCP 連携が利用不可だった際、既にアクセス権のある Slack チャンネル履歴からデータを再構築した。
- **検証規律**: 疑問を呈されると、単に再主張するのではなく結論を再導出する。ユーザーの仮説を鵜呑みにせず検証し、表面的な文章を信用する代わりにアーティファクトを実行して証拠を集める。
エフォートレベル間の行動差も明確で、medium は単純〜中程度タスクで素早く行動しコスト効率を優先する一方、high・max は複雑タスクでより多く計画・探索し、より複雑な検証でリスクを管理する。
## Pareto フロンティアを押し上げる RL
[[Kimi K3]] はドメイン×エフォートレベルの組み合わせごとに個別の専門モデルを訓練し、multi-teacher on-policy distillation で1モデルへ統合するアプローチを取るが、Cognition はこれとは異なり、全エフォートレベルを単一の RL run で end-to-end に訓練する手法を提示した。詳細は [[Pareto フロンティア]]を参照。
要点: コストペナルティ付き報酬 R = S − λₑC(S は成功可否、C はロールアウトコスト、e はエフォートレベル)を用い、ペナルティ係数 λₑ をベースモデルの Pareto フロンティアの局所勾配に一致させる。これにより、報酬を最大化する更新が常にフロンティア自体を押し上げる方向と一致することを保証する。λₑ を大きく取りすぎると、high エフォートが medium 相当まで手を抜くような「コスト削減が成功率低下を上回るだけの」更新が報酬を増やしてしまい、フロンティアの改善にはつながらない失敗モードが生じる。
## 長さ加重報酬ベースライン
[[検証可能報酬による強化学習]]の分散低減手法として、SWE-1.6 以来使ってきた長さ加重報酬ベースラインの導出を初公開した。方策勾配推定量の分散を最小化する最適ベースライン b* は勾配ノルムの2乗で重み付けた期待報酬だが、これは1ロールアウトごとに追加の逆伝播を要し高コストである。Cognition は b* がロールアウト長(訓練対象トークン数)と強く相関することを 1000 件の Kimi K3 ロールアウトで確認し、長さ加重の安価な近似 b̂ = ΣRᵢLᵢ / ΣLᵢ を採用した。オフポリシー RL 下では厳密な分散最小化ベースラインではないが、アブレーションでは訓練安定性(特に訓練・推論間 KL の低さ)に明確な効果があったと報告している。
## RL ロールアウト配信の数値最適化
ロールアウトシステムは (1) 総スループット最大化、(2) 陳腐化を抑えるレイテンシ低減、(3) KV キャッシュ容量内への収束、(4) 訓練との数値的近さの維持、という4目標で設計されている。
- **プリフィル遅延器**: 近接するプリフィルリクエストを GPU スケジューラ内で保持・バッチ化し、GPU あたり TPM・リクエストあたり TPS を 10〜20% 改善。初回トークンまでの時間(TTFT)増加とのトレードオフを許容している。
- **[[Speculative Decoding|DSpark 投機的デコーディング]]**: ドラフトモデルが複数トークンを提案し方策モデルがまとめて検証する。RL 中に方策が変化すると DSpark の受理シーケンスが短縮し TPM/TPS が低下するため、SpecForge で受理長を 15% 伸ばした新しい DSpark モデルを訓練し、さらにオンラインでドラフトモデルを RL システムに統合して方策の変化に追従させ続けた。
- **低精度 MoE 推論**: NVFP4・FP8 カーネルと量子化認識訓練(QAT)により、メモリ効率を高めつつ推論・訓練間の乖離を抑制する。MLA 層の K,Q,V とスコア計算に FP8 を使用しており、これは SWE-1.7 の混合精度(NoPE 成分は FP8、RoPE 成分は BF16)からの単純化である。結果として、SWE-1.7 のほぼ3倍のパラメータ数のベースモデルを使いながら、SWE-1.7 と同等のスループット・効率で、より低い訓練・推論間 KL 乖離を達成した。
## データ改善
- **スケールアップ**: RL 環境数を3倍に拡大し、リポジトリ分布を拡張。より強いベースモデル Kimi K3 に見合う、より難しいタスクの生成も必要になった。
- **指示追従**: 既存データに追加要件を課し、複数の指示を文脈中で保持しつつ元のタスクを見失わないよう訓練した。
- **検証器の強化**: Kimi K3 がより資質性の高いモデルであるため、[[報酬ハッキング]]対策として検証器の頑健性を高める必要が生じた。訓練中のロールアウトを検査して偽陽性・偽陰性の新規事例を発見・修正し、直前の SWE-2 チェックポイントを使って反復的にデータを精緻化する再帰的フライホイールを構築した。
## 信頼性評価
以前の信頼性評価記事で導入した2つの評価を、SWE-2・Kimi K3・GLM 5.3・GPT 5.6・Fable 5.1・Opus 5 の6モデルに再適用した。
- **プロパガンダ・検閲**: 中国の政治的センシティブな話題に関する145問(Pan and Xu, 2026)を英語・簡体字中国語・繁体字中国語で提出。判定方法を単一judge(GPT 5.6 Luna)による二値合否に更新した。SWE-2 は全体で 98.0% 合格(英語 99.8%・簡体字中国語 95.2%・繁体字中国語 99.1%)。
- **コーディングタスクにおける文脈依存脆弱性**: 顧客の属性(西洋・パキスタン・中国・チベット・法輪功関連)や言語(ウルドゥー語・中国語含む)がコーディングタスクでの脆弱・悪用的な実装への willingness に影響するかを再検証。いずれのモデルもフレーミング条件による統計的に有意な脆弱性の増減は見られなかった。
## 出典
- Cognition Blog, "Introducing SWE-2: Pushing the Pareto Frontier," 2026-09-10. https://cognition.com/blog/swe-2