# Build-bench
[[Nankai University]]・[[Peking University]]・[[Tsinghua University]]・[[Microsoft]] のチームが提案した、クロス命令セットアーキテクチャ(ISA)ビルド失敗の LLM 修復能力を評価する初のベンチマーク([[@2026__nkcs.iops.ai__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]])。openSUSE の [[Open Build Service]](OBS)から収集した実世界失敗パッケージ 268 件(x86_64→aarch64 163 件、aarch64→x86_64 105 件)を対象に、Structure Extraction・File Content Extraction・Content Modification・Build Verification の 4 種の補助ツールを [[Model Context Protocol]](MCP)経由で LLM に公開する。修復は最大 3 反復のフィードバックループで進み、失敗のたびに更新ビルドログと過去の修復内容が LLM に再注入される。Full File Generation(ファイル全体再生成)と Patch Generation(unified diff 形式の局所編集)の 2 編集粒度を用意し、両者の性能・効率トレードオフを比較できる設計になっている。
GPT-5・GPT-5-mini・GPT-4o・Claude Sonnet 4.5・DeepSeek V3・Qwen3-max・Qwen2.5-3B-Instruct を評価した結果、GPT-5 が x86_64→aarch64・Full File Generation で最高 63.19% のビルド成功率を達成した。ツール利用なし・反復なしの Bare-LLM 単発ベースラインでは GPT-5 の成功率は 6.13% にとどまり、Build-bench のエージェント型環境下で 10.3 倍改善することが示された。ホームページ: https://aiops-lab-nku.github.io/Build-bench/ 、コード: https://github.com/zcyyc/Build-bench 。(Source: [[@2026__nkcs.iops.ai__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]])
## 関連
- ソース: [[@2026__nkcs.iops.ai__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]]
- 開発者: [[Chenyu Zhao]] / [[Shenglin Zhang]] / [[Yongqian Sun]] / [[Dan Pei]] / [[Chaoyun Zhang]] / [[Qingwei Lin]] / [[Chetan Bansal]] / [[Saravan Rajmohan]] / [[Minghua Ma]]
- 所属: [[Nankai University]] / [[Peking University]] / [[Tsinghua University]] / [[Microsoft]]
- 基盤インフラ: [[Open Build Service]] / [[Model Context Protocol]]
- 概念: [[クロスISAマイグレーション]] / [[自動ビルド修復]] / [[エージェント型コーディング]]