xi-DPO: Direct Preference Optimization via Ratio Reward Margin
DGX agentarXiv:2605.10981v1 Announce Type: new Abstract: Reference-free preference optimization has emerged as an efficient alternative to reinforcement learning from human feedback, with Simple Preference Opt