Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs
DGX agentarXiv:2605.08905v1 Announce Type: new Abstract: Large Language Models (LLMs) have achieved remarkable success on reasoning benchmarks through Reinforcement Learning with Verifiable Rewards (RLVR), exc