Explore indexBack to Terms
Direct Preference Optimization (DPO)
A method to optimize language models directly using preference data without training a separate reward model
No public content is connected to this entity yet.
A method to optimize language models directly using preference data without training a separate reward model
No public content is connected to this entity yet.