When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs
DGX agentarXiv:2608.10489v1 Announce Type: new Abstract: Abundant visual information strengthens vision-language model (VLM) perception, yet massive visual tokens raise inference costs. Existing visual token p