# Qwen2.5-32B
Qwen チームが公開する 32B パラメータの事前学習済みベースモデル(instruction-tuned でも RLHF 済みでもない)。DAPO([[@2025__arXiv__DAPO - An Open-Source LLM Reinforcement Learning System at Scale]])はこのベースモデルに対し RL のみで推論能力を引き出し、AIME 2024 で avg@32 = 50 点を達成した。DeepSeek-R1-Zero-Qwen-32B も同じベースモデルに RL を適用しており、両論文の直接比較対象になっている(Source: [[@2025__arXiv__DAPO - An Open-Source LLM Reinforcement Learning System at Scale]])。
## 関連
- ソース: [[@2025__arXiv__DAPO - An Open-Source LLM Reinforcement Learning System at Scale]]
- 比較対象: [[DeepSeek-R1-Zero]](同一ベースモデルに RL を適用した先行研究)