The Unlearnability Phenomenon in RLVR for Language Models
DGX agentarXiv:2605.16787v1 Announce Type: cross Abstract: Reinforcement Learning with Verifiable Reward (RLVR) has proven effective in improving Large Language Model's (LLM) reasoning ability. However, the le