PreprintNeural Information Processing Systems2025
DAPO: An Open-Source LLM Reinforcement Learning System at Scale
Qiying Yu, Zheng Zhang, Ruofei Zhu, et al.
DAPO is an open-source large-scale LLM reinforcement learning system with a novel algorithm achieving 50 points on AIME 2024 using Qwen2.5-32B, releasing training code and data.
2.3kMar 18, 2025Reinforcement LearningReasoning
arXiv