# Chatbot Arena
[[LMSYS]] が開発した LLM 評価のオープンプラットフォーム(https://chat.lmsys.org、後に LMArena という名称に統一)。匿名の 2 モデルに同一プロンプトを投げ、ユーザーが好みを選ぶペアワイズ比較方式でデータを収集。収集した投票を Bradley-Terry モデル([[Bradley-Terryモデル]])で統計的にランキングし、LLM リーダーボードとして公開する。2023-04 から稼働し 2024-01 時点で 90K ユーザー・240K 票・50+ モデルを対象とする。業界で最も参照される LLM リーダーボードの一つ。
詳細: [[@2024__arXiv__Chatbot Arena - An Open Platform for Evaluating LLMs by Human Preference]]
## 2025年4月時点の状況(『原論文から解き明かす生成AI』第8章による)
2025 年 4 月 30 日時点では、テキスト生成 229 モデル・280 万件超の評価データ、text-to-image による画像生成 8 モデル・21 万件超の評価データを蓄積している(テキスト生成ランキングは Google の Gemini-2.5-Pro-Exp-03-25 がトップ、画像生成ランキングは Google の Imagen 3 がトップ)。競争を促進し生成 AI モデルの発展に寄与した一方、モデル性能の向上により回答の質の差異が小さくなり、表現や言い回しの好みで優劣が決まりやすくなったことで、ランキングが持つ意味は薄れてきている。2025 年 4 月 5 日リリースの Llama 4 が公開モデルと異なる調整版で高スコアを獲得し物議を醸した件や、Chatbot Arena の問題点を指摘する『The Leaderboard Illusion』論文の存在が例として挙げられている。(Source: [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 8 生成AIモデルの評価]] §8.1)