Preprint2025
Nover: Incentive training for language models via verifier-free reinforcement learning
Unknown
Nover introduces verifier-free reinforcement learning for language models, eliminating the need for large verifier models and their computational costs.
0Jan 1, 2025Reinforcement Learning