# Qwen2.5-32B Qwen チームが公開する 32B パラメータの事前学習済みベースモデル(instruction-tuned でも RLHF 済みでもない)。DAPO([[@2025__arXiv__DAPO - An Open-Source LLM Reinforcement Learning System at Scale]])はこのベースモデルに対し RL のみで推論能力を引き出し、AIME 2024 で avg@32 = 50 点を達成した。DeepSeek-R1-Zero-Qwen-32B も同じベースモデルに RL を適用しており、両論文の直接比較対象になっている(Source: [[@2025__arXiv__DAPO - An Open-Source LLM Reinforcement Learning System at Scale]])。 ## 関連 - ソース: [[@2025__arXiv__DAPO - An Open-Source LLM Reinforcement Learning System at Scale]] - 比較対象: [[DeepSeek-R1-Zero]](同一ベースモデルに RL を適用した先行研究)