Finite-Time Analysis of the Natural Policy Gradient in Finite-Horizon Markov Decision Processes
arXiv:2607.22982v1 Announce Type: new Abstract: Natural Policy Gradient (NPG) is a well-established Reinforcement Learning algorithm that underlies widely used methods such as Trust Region Policy Opti