Addressing Finite-Horizon MDPs via Low-Rank Tensor Value Approximation
DGX agentarXiv:2501.10598v3 Announce Type: replace Abstract: We study the problem of learning optimal policies in finite-horizon Markov Decision Processes (MDPs) using low-rank reinforcement learning (RL) meth