Bias Fitting to Mitigate Length Bias of Reward Model in RLHF
DGX agentarXiv:2505.12843v2 Announce Type: replace Abstract: Reinforcement Learning from Human Feedback (RLHF) relies on reward models to align large language models with human preferences. However, RLHF often