FlowAWR: Online Adaptive Flow Reinforcement via Advantage-Weighted Rectification
DGX agentarXiv:2606.30376v1 Announce Type: cross Abstract: Aligning generative flow models on continuous spaces via online reinforcement learning is constrained by intractable trajectory likelihoods. Existing