Efficient Reinforcement Learning for Long-Horizon Tool-Use Agentic Tasks
DGX agentarXiv:2608.10357v1 Announce Type: cross Abstract: Long-horizon tool-using agents must reason over user goals, domain policies, tool calls, simulator state, and delayed verifiable rewards. Reinforcemen