Structured Role-Aware Policy Optimization for Multimodal Reasoning
DGX agentarXiv:2605.07274v1 Announce Type: new Abstract: Reinforcement learning from verifiable rewards (RLVR), especially with Group Relative Policy Optimization (GRPO), has shown strong potential for improvi