R3G: A Reasoning-Retrieval-Reranking Framework for Vision-Centric Answer Generation
arXiv:2602.00104v3 Announce Type: replace-cross Abstract: Vision-centric retrieval for VQA requires retrieving images to supply missing visual cues and integrating them into the reasoning process. How