Improving Reasoning in Vision-Language Models via Perception Verified Self-Training
arXiv:2606.22158v1 Announce Type: new Abstract: Achieving human-like reasoning in Vision-Language Models (VLMs) remains a long-standing challenge. Recent approaches leverage Chain-of-Thought (CoT) rat