Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning
DGX agentarXiv:2602.23440v4 Announce Type: replace Abstract: Reinforcement learning has emerged as an effective paradigm for training large language models to interleave reasoning with search engine calls. How