# SWE-Together
[[Meta]] の Yifan Wu・Shengzhi Li らが 2026 年 6 月に提案した、対話型コーディングエージェントのためのマルチターンベンチマーク。従来の静的・ワンショットな [[SWE-Bench-Verified]] や [[SWE-bench Pro]] と異なり、実際の開発者とコーディングエージェントの対話セッションログ(11,260 件)から厳選した 109 件のリポジトリレベルタスクで構成される。
エージェントの進行状況に応動する状態条件付き LLM ユーザーシミュレータを備え、最終的なコードの正しさだけでなく、対話中に人間側が強いられる修正負担(User Correction)やシミュレータ忠実度(Intent Coverage)を測定する二次元評価プロトコルを提供する。(Source: [[@2026__arXiv__SWE-Together - Evaluating Coding Agents in Interactive User Sessions]])
## 関連
- ソース: [[@2026__arXiv__SWE-Together - Evaluating Coding Agents in Interactive User Sessions]]
- 関連ベンチマーク: [[SWE-bench Pro]] / [[SWE-Bench-Verified]]
- 概念: [[コーディングエージェント評価]] / [[エージェント軌跡評価]] / [[本番接地型ベンチマーク]]
- 組織・人物: [[Meta]] / [[Yifan Wu]] / [[Shengzhi Li]]
## 出典
- [[@2026__arXiv__SWE-Together - Evaluating Coding Agents in Interactive User Sessions]]