Semantic-Space Exploration and Exploitation in RLVR for LLM Reasoning
arXiv:2509.23808v4 Announce Type: replace-cross Abstract: Reinforcement Learning with Verifiable Rewards (RLVR) for LLM reasoning is often framed as balancing exploration and exploitation in action sp