A minimaximalist approach to reinforcement learning from human feedback
Unknown
Self-Play Preference Optimization (SPO) is a minimalist reinforcement learning from human feedback algorithm that avoids training a separate reward model by using self-play.