SOPE: Stabilizing Off-Policy Evaluation for Online RL with Prior Data
DGX agentarXiv:2605.05863v2 Announce Type: replace Abstract: Incorporating prior data into online reinforcement learning accelerates training but typically forces a difficult trade-off between high computation