BranPO: Scalable Contrastive Branch Sampling for Long-Horizon Agentic Reinforcement Learning
DGX agentarXiv:2602.03719v2 Announce Type: replace Abstract: Agentic reinforcement learning enables large language models to perform multi-turn planning and tool use, but long-horizon training remains challeng