Preprint2026
Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization
Zhicheng Cai, Xinyuan Guo, Hanlin Wu, et al.
Reveals PPO-Clip's Euclidean geometry flaw causing exploration collapse in LLM RL and proposes Riemannian Isometric Policy Optimization (RIPO) for balanced exploration.
0Jul 11, 2026Reinforcement LearningReasoning
arXiv