Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models
DGX agentarXiv:2604.01840v2 Announce Type: replace Abstract: While Reinforcement Learning from Verifiable Rewards (RLVR) has advanced reasoning in Large Vision-Language Models (LVLMs), prevailing frameworks su