# Harbor Harbor は、AI エージェントの大規模・再現可能な評価を実行・管理するためのオープンソースフレームワークである。Laude Institute および Terminal-Bench チームによって開発・公開された。 ## 主な特徴 - **レジストリと CLI**: タスクセットをレジストリ経由で配布し、`harbor run -d [email protected]` のような直感的なコマンドラインインターフェースで即座にベンチマークを実行可能。 - **分散コンテナサンドボックス統合**: Daytona などのコンテナサンドボックス基盤と標準連携し、数十〜100 並行のコンテナ環境上でエージェント評価をスケーラブルに分散実行できる。 - **アダプター(Adapters)機構**: SWE-bench や InterCode など 26 種の外部ベンチマークを Harbor の統一タスクスキーマ(指示・Dockerfile・テスト・オラクル解法)に変換するインターフェース層を備える。パリティ実験(同一モデル・足場での変換前後の結果一致検証)を通じてベンチマークの評価意味論を損なわずに多種多様なベンチマークを共通ハーネスで実行可能にする。 ## 関連 - [[Terminal-Bench]] - [[Terminus 2]] - [[コーディングエージェント評価]] ## 出典 - [[@2026__arXiv__Terminal-Bench - Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces]]