FP4 Explore, BF16 Train: Diffusion Reinforcement Learning via Efficient Rollout Scaling
arXiv:2604.06916v1 Announce Type: cross Abstract: Reinforcement-Learning-based post-training has recently emerged as a promising paradigm for aligning text-to-image diffusion models with human prefere