Text-Guided Visual Dependency Graph Learning with Cross-Modal Attention Priors
DGX agentarXiv:2608.21443v1 Announce Type: new Abstract: Estimating interpretable conditional-dependence structures from multimodal visual-linguistic features remains largely unexplored. We propose CM-GLasso (