Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control
DGX agentarXiv:2604.03540v2 Announce Type: replace Abstract: Although multi-step generative policies achieve strong performance in robotic manipulation by modeling multimodal action distributions, they require