# Terminus 2 Terminus 2 は、Terminal-Bench において各種言語モデル(LLM)の純粋な能力を公平に比較するために設計された、最小構成(Minimal・Unopinionated)のコマンドラインエージェント足場(ハーネス)である。 ## アーキテクチャと動作原理 - **純粋なキーストローク対話**: Claude Code や OpenHands、Gemini CLI のような専用のファイル編集ツール・検索ツール・ダウンロード用 API を一切持たず、エージェントは Docker コンテナ内の tmux シェルに対して純粋な Bash コマンドのキーストローク(文字列)を発行し、実行後のペイン表示(標準出力・標準エラー出力・対話画面)を観測として受け取るループで動作する。 - **ツールの非依存性**: ファイル作成・編集時に `echo` や `cat` でスクリプトを直接書き出すか、`vim` や `emacs` などの対話型エディタを立ち上げて操作するかはすべて言語モデル側の判断に委ねられる。 - **コンテキスト要約モジュール**: 長大な長期ホライズンタスクにおいてモデルのコンテキスト制限に達した際、「次のエージェントに作業を引き継ぐための要約」を別プロンプトで生成し、作業履歴を圧縮して再投入することで、数千万〜1億トークン規模の長時間タスク遂行を可能にしている。 ## 関連 - [[Terminal-Bench]] - [[Harbor]] - [[コーディングエージェント評価]] ## 出典 - [[@2026__arXiv__Terminal-Bench - Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces]]