TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment
DGX agentarXiv:2605.10983v1 Announce Type: cross Abstract: Reinforcement learning (RL) has shown extraordinary potential in aligning diffusion models to downstream tasks, yet most of them still suffer from sig