ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison
DGX agentarXiv:2605.20278v1 Announce Type: cross Abstract: Long-form image captioning exposes a reward granularity problem in RL: captions are judged as whole sequences, while the important errors occur at the