Robust Grounding with MLLMs against Occlusion and Small Objects via Language-guided Semantic Cues
DGX agentarXiv:2604.24036v1 Announce Type: new Abstract: While Multimodal Large Language Models (MLLMs) have enhanced grounding capabilities in general scenes, their robustness in crowded scenes remains undere