# SWE-Bench Multilingual Yang+ "SWE-smith: Scaling Data for Software Engineering Agents" (arXiv:2504.21798) を出典とする、多言語コードベースを対象とした SWE-bench 系列のベンチマーク(swebench.com/multilingual)。[[SWE-1.7]] のブログ記事では評価軸の一つとして使われ、SWE-1.7 が 77.8% を記録した(Kimi K2.7 Code 73.5%・GPT-5.5 76.8%・Opus 4.8 84.4%)。評価は自己報告値が利用可能な場合はそれを使用し、そうでなければ Devin CLI で評価する方式が取られている(Source: [[@2026__Cognition__SWE-1.7 - Frontier Intelligence at a Fraction of the Cost]])。 > [!note] [[SWE-Bench-Verified]] との関係 > 既存 wiki には OpenAI が報告を停止した [[SWE-Bench-Verified]] のページがある。SWE-Bench Multilingual は同じ SWE-bench 系譜の別バリアント(多言語コードベース版)であり、Verified とは評価対象コードベースの言語構成が異なる。 ## 出典 - [[@2026__Cognition__SWE-1.7 - Frontier Intelligence at a Fraction of the Cost]]