MergeOver: Post-Training Token Merging for Recursive Vision Transformers
arXiv:2608.13141v1 Announce Type: new Abstract: Vision Transformers (ViTs) demonstrate exceptional performance in computer vision but suffer from large parameter counts and quadratic computational com