ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning
DGX agentarXiv:2606.13316v2 Announce Type: replace Abstract: Reinforcement Learning with Verifiable Rewards (RLVR) is a central technique for improving long-horizon reasoning in Large Language Models (LLMs). H