# Harbor
Harbor は、AI エージェントの大規模・再現可能な評価を実行・管理するためのオープンソースフレームワークである。Laude Institute および Terminal-Bench チームによって開発・公開された。
## 主な特徴
- **レジストリと CLI**: タスクセットをレジストリ経由で配布し、`harbor run -d
[email protected]` のような直感的なコマンドラインインターフェースで即座にベンチマークを実行可能。
- **分散コンテナサンドボックス統合**: Daytona などのコンテナサンドボックス基盤と標準連携し、数十〜100 並行のコンテナ環境上でエージェント評価をスケーラブルに分散実行できる。
- **アダプター(Adapters)機構**: SWE-bench や InterCode など 26 種の外部ベンチマークを Harbor の統一タスクスキーマ(指示・Dockerfile・テスト・オラクル解法)に変換するインターフェース層を備える。パリティ実験(同一モデル・足場での変換前後の結果一致検証)を通じてベンチマークの評価意味論を損なわずに多種多様なベンチマークを共通ハーネスで実行可能にする。
## 関連
- [[Terminal-Bench]]
- [[Terminus 2]]
- [[コーディングエージェント評価]]
## 出典
- [[@2026__arXiv__Terminal-Bench - Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces]]