# SWE-Bench Multilingual
Yang+ "SWE-smith: Scaling Data for Software Engineering Agents" (arXiv:2504.21798) を出典とする、多言語コードベースを対象とした SWE-bench 系列のベンチマーク(swebench.com/multilingual)。[[SWE-1.7]] のブログ記事では評価軸の一つとして使われ、SWE-1.7 が 77.8% を記録した(Kimi K2.7 Code 73.5%・GPT-5.5 76.8%・Opus 4.8 84.4%)。評価は自己報告値が利用可能な場合はそれを使用し、そうでなければ Devin CLI で評価する方式が取られている(Source: [[@2026__Cognition__SWE-1.7 - Frontier Intelligence at a Fraction of the Cost]])。
> [!note] [[SWE-Bench-Verified]] との関係
> 既存 wiki には OpenAI が報告を停止した [[SWE-Bench-Verified]] のページがある。SWE-Bench Multilingual は同じ SWE-bench 系譜の別バリアント(多言語コードベース版)であり、Verified とは評価対象コードベースの言語構成が異なる。
## 出典
- [[@2026__Cognition__SWE-1.7 - Frontier Intelligence at a Fraction of the Cost]]