One-Step Bellman Alignment Enables Provably Efficient Transfer in Online RL
DGX agentarXiv:2601.21924v2 Announce Type: replace Abstract: We study online transfer reinforcement learning (RL) in episodic Markov decision processes, where experience from related source tasks is available