How Off-Policy Can GRPO Be? Mu-GRPO for Efficient LLM Reinforcement Learning
arXiv:2605.17570v1 Announce Type: cross Abstract: Group Relative Policy Optimization (GRPO) has been a key driver of recent progress in reinforcement learning with verifiable rewards (RLVR) for large