# Terminal-Bench The Terminal-Bench Team による、ターミナル環境で動作する AI エージェントを評価するベンチマーク(tbench.ai)。[[SWE-1.7]] のブログ記事では Terminal-Bench 2.1 が評価軸の一つとして使われ、SWE-1.7 が 81.5% を記録した(Kimi K2.7 Code 72.7%・GPT-5.5 84.2%・Opus 4.8 86.9%)。評価方法は独自の内部評価フレームワーク上で、Anthropic モデルには Claude Code、OpenAI モデルには Codex、それ以外のモデルには Devin CLI をハーネスとして使用し、timeout=4h で実施されている(Source: [[@2026__Cognition__SWE-1.7 - Frontier Intelligence at a Fraction of the Cost]])。 ## 出典 - [[@2026__Cognition__SWE-1.7 - Frontier Intelligence at a Fraction of the Cost]]