Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models
DGX agentarXiv:2509.22415v3 Announce Type: replace-cross Abstract: Multimodal large language models (MLLMs) have achieved strong vision-language performance, yet their token-level visual evidence remains diffi