HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime
arXiv:2605.30201v1 Announce Type: cross Abstract: We investigate a narrow but common failure mode of GRPO-style reinforcement learning in the context of sparse verifiable rewards: early updates contai