Preprint2026
Parameter Exploration for RLVR via Variational Learning
Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych
Introduces parameter-space exploration for LLM RL via Perturbed Parameter Policy Optimization (3PO), improving downstream performance over GRPO at similar FLOPs.
0Aug 10, 2026Reinforcement LearningReasoning
arXiv