Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models
arXiv:2606.30168v1 Announce Type: new Abstract: Multimodal large language models (MLLMs) often fail in fine-grained visual reasoning, as question-relevant visual cues are diluted by dense and redundan