MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization
DGX agentarXiv:2605.10784v1 Announce Type: new Abstract: Multi-negative preference optimization under the Plackett--Luce (PL) model extends Direct Preference Optimization (DPO) by leveraging comparative signal