AdaMerge: Salience-Aware Adaptive Token Merging for Training-Free Acceleration of Vision Transformers
arXiv:2605.27465v1 Announce Type: cross Abstract: The quadratic cost of self-attention in Vision Transformers (ViTs) constitutes a fundamental bottleneck for practical deployment, motivating a vibrant