Graph-Enhanced Policy Optimization in LLM Agent Training
DGX agentarXiv:2510.26270v2 Announce Type: replace Abstract: Multi-step LLM agents in interactive environments represent a crucial step toward long-horizon decision-making. To train such agents, group-based re