Similarity Is Not Logic: Factored Inference for Dual-Encoder Vision-Language Models
DGX agentarXiv:2607.23052v1 Announce Type: cross Abstract: Dual-encoder vision-language models (VLMs) expose a similarity interface that enables zero-shot retrieval but fails compositional constraints: queries