# TravelPlanner Xie et al. (2024, ICML, PMLR vol.235) が提案する、実世界の旅行計画タスクで言語エージェントの計画能力を評価するベンチマーク。 LongRCA Bench 論文([[@2026__arXiv__LongRCA Bench - Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures]]、arXiv 2026-08)は、5 つの失敗軌跡ソースのうち最大の割合を占めるソースとして TravelPlanner を使い、[[AutoGen]] MagenticOneGroupChat(グループチャット協調)構成で 685 件(全体の 60.1%)の非注入失敗軌跡を収集した(旅行計画ドメイン)。軌跡はエージェント生成モデルとして MiniMax-M2.5(265 件)・Kimi-K2.5(260 件)・Qwen3.5-Plus(160 件)の 3 モデルにまたがる。TravelPlanner が LongRCA Bench 全体の過半数を占めるため、ソース構成に強く依存する分析(層別精度等)の解釈には注意が必要だと著者らは明示する。(Source: [[@2026__arXiv__LongRCA Bench - Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures]]) ## 関連 - ソース: [[@2026__arXiv__LongRCA Bench - Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures]] - 概念: [[マルチエージェント協調]]