Last-Iterate Convergence of General Parameterized Policies in Constrained MDPs
DGX agentarXiv:2408.11513v2 Announce Type: replace Abstract: This paper focuses on learning a Constrained Markov Decision Process (CMDP) via general parameterized policies. We propose a Primal-Dual based Regul