PreprintarXiv.org2025
Geometric-Mean Policy Optimization
Yuzhong Zhao, Yue Liu, Junpeng Liu, et al.
GMPO improves GRPO stability by replacing arithmetic mean with geometric mean of token rewards, reducing outlier sensitivity and boosting reasoning performance.
95Jul 28, 2025Large Language ModelsReasoning
arXiv