Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning
DGX agentarXiv:2607.02490v1 Announce Type: new Abstract: Large vision-language models can reason over multimodal inputs by generating textual chains of thought (CoT). A key capability exhibited in CoT reasonin