Beyond Policy Optimization: A Data Curation Flywheel for Sparse-Reward Long-Horizon Planning
DGX agentarXiv:2508.03018v2 Announce Type: replace Abstract: Large Language Reasoning Models have demonstrated remarkable success on static tasks, yet their application to multi-round agentic planning in inter