Quality Text, Robust Vision: The Role of Language in Enhancing Visual Robustness of Vision-Language Models
arXiv:2507.16257v2 Announce Type: replace Abstract: Defending pre-trained vision-language models (VLMs), such as CLIP, against adversarial attacks is crucial, as these models are widely used in divers