On the Intrinsic Limits of Transformer Image Embeddings in Non-Solvable Spatial Reasoning
DGX agentarXiv:2601.03048v2 Announce Type: replace-cross Abstract: Vision Transformers (ViTs) excel in semantic recognition but exhibit systematic failures in spatial reasoning tasks such as mental rotation. W