Direct Preference Optimization: Your Language Model is Secretly a Reward Model logo

Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Free
FreeFree tier
Type
Open Source

About Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Found in: Hannibal046/Awesome-LLM