# SWE-Together [[Meta]] の Yifan Wu・Shengzhi Li らが 2026 年 6 月に提案した、対話型コーディングエージェントのためのマルチターンベンチマーク。従来の静的・ワンショットな [[SWE-Bench-Verified]] や [[SWE-bench Pro]] と異なり、実際の開発者とコーディングエージェントの対話セッションログ(11,260 件)から厳選した 109 件のリポジトリレベルタスクで構成される。 エージェントの進行状況に応動する状態条件付き LLM ユーザーシミュレータを備え、最終的なコードの正しさだけでなく、対話中に人間側が強いられる修正負担(User Correction)やシミュレータ忠実度(Intent Coverage)を測定する二次元評価プロトコルを提供する。(Source: [[@2026__arXiv__SWE-Together - Evaluating Coding Agents in Interactive User Sessions]]) ## 関連 - ソース: [[@2026__arXiv__SWE-Together - Evaluating Coding Agents in Interactive User Sessions]] - 関連ベンチマーク: [[SWE-bench Pro]] / [[SWE-Bench-Verified]] - 概念: [[コーディングエージェント評価]] / [[エージェント軌跡評価]] / [[本番接地型ベンチマーク]] - 組織・人物: [[Meta]] / [[Yifan Wu]] / [[Shengzhi Li]] ## 出典 - [[@2026__arXiv__SWE-Together - Evaluating Coding Agents in Interactive User Sessions]]