When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient
DGX agentarXiv:2604.25872v1 Announce Type: new Abstract: Training language models via reinforcement learning often relies on imperfect proxy rewards, since ground truth rewards that precisely define the intend