Today for AI
Explore indexBack to Terms

Direct Preference Optimization (DPO)

A method to optimize language models directly using preference data without training a separate reward model

No public content is connected to this entity yet.