LEMON: Learning Executable Multi-Agent Orchestration via Counterfactual Reinforcement Learning
DGX agentarXiv:2605.14483v1 Announce Type: new Abstract: Large language models (LLMs) have become a strong foundation for multi-agent systems, but their effectiveness depends heavily on orchestration design. A