# SWE-bench Pro Deng et al. (2025, arXiv:2509.16941) が提案する、AI エージェントが長期水平のソフトウェアエンジニアリングタスクを解けるかを評価するベンチマーク。SWE-Bench 系列の中でもより長い実行履歴・複雑な修正を要求する設計になっている。 LongRCA Bench 論文([[@2026__arXiv__LongRCA Bench - Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures]]、arXiv 2026-08)は、5 つの失敗軌跡ソースの 1 つとして SWE-bench Pro を使い、DiagnostAgent–ActionAgent–JudgeAgent というカスタムのチーム構成で 128 件の非注入(natural)失敗軌跡を収集した(ソフトウェア修復ドメイン)。ソース別の軌跡長中央値は 257.5 ステップと 5 ソース中最長であり、Figure 1 のケーススタディ(SWE-bench Pro の ansible タスク、根本原因ステップ 37 に対し最終失敗が 163 ステップ目、126 ステップの下流伝播)にも使われている。(Source: [[@2026__arXiv__LongRCA Bench - Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures]]) ## 関連 - ソース: [[@2026__arXiv__LongRCA Bench - Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures]] - 関連ベンチマーク: [[SWE-Bench-Verified]] / [[SWE-Bench Multilingual]] - 概念: [[コーディングエージェント評価]]