Bridging Offline and Online Reinforcement Learning for LLMs
Jack Lanchantin, Angelica Chen, Janice Lan, et al.
This paper compares offline, semi-online, and fully online RL finetuning methods for LLMs, finding online and semi-online DPO and GRPO variants perform similarly and outperform offline methods, with multi-tasking across verifiable and non-verifiable