Direct Preference Optimization: Your Language Model Is a Reward Modelarxiv.org3 points·ntonozzi··0 commentsOpen articleSaveView on HN