CROP: Conservative Reward for Model-based Offline Policy Optimization
DGX agentarXiv:2310.17245v2 Announce Type: replace-cross Abstract: Offline reinforcement learning (RL) aims to optimize a policy using collected data without online interactions. Model-based approaches are par