Momentum for Reasoning: Dense Intrinsic Signals in Policy Optimization
DGX agentarXiv:2606.08815v1 Announce Type: new Abstract: Reinforcement learning with verifiable rewards (RLVR) has emerged as a powerful paradigm for eliciting long-chain reasoning in large language models. Ho