MMR-GRPO: Accelerating GRPO-Style Training through Diversity-Aware Reward Reweighting
DGX agentarXiv:2601.09085v2 Announce Type: replace-cross Abstract: Group Relative Policy Optimization (GRPO) has become a standard approach for training mathematical reasoning models; however, its reliance on