Vision Transformers Need Better Token Interaction
DGX agentarXiv:2605.23868v1 Announce Type: new Abstract: Vision Transformers (ViTs) can learn strong image-level representations while their patch representations become less effective for dense prediction dur