VLMs Trace Without Tracking: Diagnosing Failures in Visual Path Following
DGX agentarXiv:2605.15672v1 Announce Type: cross Abstract: Vision-language models (VLMs) achieve strong performance on multimodal benchmarks, but may still lack robust control over basic visual operations. We