Safe Equilibrium Policy Optimization for Strategic Agent Policies
DGX agentarXiv:2605.30854v1 Announce Type: cross Abstract: Language models fine-tuned with reinforcement learning typically optimize for task reward, ignoring multi-agent strategic structure. Because these age