Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression
DGX agentarXiv:2608.09176v1 Announce Type: cross Abstract: Visual token compression for vision--language models (VLMs) has largely relied on criteria such as attention, redundancy, and uncertainty to maximize