Accelerating Vision Transformers with Adaptive Patch Sizes
DGX agentarXiv:2510.18091v2 Announce Type: replace-cross Abstract: Vision Transformers (ViTs) partition input images into uniformly sized patches regardless of their content, resulting in long input sequence l