Pairwise Preference Reward and Group-Based Diversity Enhancement for Superior Open-Ended Generation
arXiv:2605.18191v1 Announce Type: new Abstract: Current reinforcement learning(RL) methods are broadly applicable and powerful in verifiable settings where scalar rewards can be provided. However, in