Text as Partial Constraint: Core-Residual Alignment for Robust Vision-Language Learning
arXiv:2607.03143v1 Announce Type: cross Abstract: Vision-language alignment powers open-vocabulary recognition, retrieval, and LVLM grounding, yet natural captions are often underspecified, making sim