# VitaBench He et al. (2026, ICLR, arXiv:2509.26490) が提案する、実世界アプリケーションにおける多様なインタラクティブタスクで LLM エージェントを評価するベンチマーク。 LongRCA Bench 論文([[@2026__arXiv__LongRCA Bench - Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures]]、arXiv 2026-08)は、5 つの失敗軌跡ソースの 1 つとして VitaBench を使い、Sequential agent または planner–critic–action team という構成で 108 件の非注入失敗軌跡を収集した(サービス指向ツール利用ドメイン)。5 ソース中で軌跡長中央値が最短(51 ステップ)であり、他ソース(SWE-bench Pro 中央値 257.5 ステップ等)との対比で LongRCA Bench の長さレンジの下限を形成する。(Source: [[@2026__arXiv__LongRCA Bench - Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures]]) ## 関連 - ソース: [[@2026__arXiv__LongRCA Bench - Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures]]