Multimodal Generative Engine Optimization: Rank Manipulation for Vision-Language Model Rankers
arXiv:2601.12263v2 Announce Type: replace-cross Abstract: Vision-Language Models (VLMs) integrate visual and textual knowledge into unified representations that increasingly underpin modern retrieval