PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping
arXiv:2606.08708v1 Announce Type: new Abstract: Reinforcement Learning with Verifiable Rewards (RLVR) has become an effective paradigm for improving the reasoning capability of Large Vision-Language M