DE-FIVE: Detecting Malicious Image Prompts via Fourier Features and Image Vector Embeddings
arXiv:2606.22779v1 Announce Type: cross Abstract: Vision language models (VLMs) employ both visual and textual modalities to enable advanced vision-language inference. However, incorporating visual mo