MAPS: Multi-Anchor Projection Similarity for Joint Vision-Language Geo-Localization
arXiv:2606.22543v1 Announce Type: new Abstract: Humans localize places by integrating perceptual cues from vision with semantic reasoning from language, forming a scene understanding that is both intu