Does the Question Really Matter? Training-Free Data Selection for Vision-Language SFT
DGX agentarXiv:2603.09715v2 Announce Type: replace Abstract: Visual instruction tuning is crucial for improving vision-language large models (VLLMs). However, many samples can be solved via linguistic patterns