VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning
arXiv:2605.28023v1 Announce Type: cross Abstract: Visual captioning requires models to capture visual content faithfully while minimizing both omission and hallucination. As the dominant paradigm for