# Terminal-Bench
The Terminal-Bench Team による、ターミナル環境で動作する AI エージェントを評価するベンチマーク(tbench.ai)。[[SWE-1.7]] のブログ記事では Terminal-Bench 2.1 が評価軸の一つとして使われ、SWE-1.7 が 81.5% を記録した(Kimi K2.7 Code 72.7%・GPT-5.5 84.2%・Opus 4.8 86.9%)。評価方法は独自の内部評価フレームワーク上で、Anthropic モデルには Claude Code、OpenAI モデルには Codex、それ以外のモデルには Devin CLI をハーネスとして使用し、timeout=4h で実施されている(Source: [[@2026__Cognition__SWE-1.7 - Frontier Intelligence at a Fraction of the Cost]])。
LongRCA Bench 論文([[@2026__arXiv__LongRCA Bench - Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures]])は「Terminal Bench 2」を 5 つの失敗軌跡ソースの 1 つとして使い、42 件の失敗軌跡(diagnosis–execution–verification team 構成)を収集した。ICLR 2026 に掲載された Merrill et al. のベンチマーク論文(arXiv:2601.11868)として引用されており、Cognition の SWE-1.7 ブログ記事が言及する Terminal-Bench 2.1 と同系列のバージョンだと推定される。(Source: [[@2026__arXiv__LongRCA Bench - Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures]])
## 出典
- [[@2026__arXiv__LongRCA Bench - Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures]]
- [[@2026__Cognition__SWE-1.7 - Frontier Intelligence at a Fraction of the Cost]]