Environment Parameter Gradient Theorem for Policy-Environment Co-Design in Reinforcement Learning
DGX agentarXiv:2607.12590v1 Announce Type: cross Abstract: Reinforcement learning (RL) is traditionally concerned with learning a control policy for a fixed environment. In many engineering systems, however, t