Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback
DGX agentarXiv:2607.26094v1 Announce Type: cross Abstract: Reinforcement Learning from Human Feedback (RLHF) is the standard approach for aligning large language models with human preferences, but its quality