# SWE-2 [[Cognition]] が 2026-09-10 に発表した、同社が訓練した最も能力の高いエージェント型コーディングモデル。[[Kimi K3]](2.8T パラメータ)をベースに、[[SWE-1.7]] の訓練基盤・レシピを継承しつつ、初めて数兆パラメータ規模へ RL をスケールした。中心的な新規性は、medium/high/max の全エフォートレベルを単一の RL run で同時に訓練し、コスト–性能の [[Pareto フロンティア]]全体を形状を保ったまま押し上げる手法である。[[Devin]] Desktop・CLI で提供開始、Web・Fusion へも展開中(Source: [[@2026__Cognition__SWE-2 - Pushing the Pareto Frontier]])。 ## ベンチマーク成績 | ベンチマーク | SWE-2 | Kimi K3 | Grok 4.6 | Fable 5.1 | GPT-5.6 Sol | GPT-6 Astra | SWE-1.7 | |---|---|---|---|---|---|---|---| | [[FrontierCode]] 1.1 Main | 50.0% | 44.2% | 48.0% | 50.9% | 47.5% | 53.3% | 42.0% | | [[DeepSWE]] 1.1 | 73.0% | 68.5% | 67.5% | 67.4% | 72.7% | 74.1% | 37.7% | | [[Terminal-Bench]] 2.1 | 92.8% | 88.3% | 88.4% | 91.4% | 88.8% | 89.9% | 81.5% | ベースモデルの [[Kimi K3]] に対して多くのベンチマークで 5〜6 ポイント上乗せし、K3 のコスト–性能フロンティア全体をシフトさせた。GPT-5.6 Sol・Fable 5.1 に僅差の性能を大幅に低いコストで実現し、GPT-6 Astra には数ポイント差まで肉薄しつつコストは4分の1に留まる。 ## 行動的特徴 [[SWE-1.7]] と比較して、FrontierCode 1.1 Main でのターン数を 58% 削減、平均コストを 81% 削減した。最初の実質的な編集までの中央値ステップ数は 48(SWE-1.7)から 18(SWE-2 medium)へ短縮されており、Cognition はこれを探索量の単純な削減ではなく「重要な箇所を判断する能力向上による焦点を絞った探索」と分析している。テストカバレッジの改善、境界内での資質性(代替経路の探索)、検証規律(仮説の鵜呑みをせず再検証する)という3つの行動特性も報告されている。 ## 出典 - [[@2026__Cognition__SWE-2 - Pushing the Pareto Frontier]]