Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains
DGX agentarXiv:2602.13235v2 Announce Type: replace-cross Abstract: Visual Retrieval-Augmented Generation (VRAG) enhances Vision-Language Models (VLMs) by incorporating external visual documents to address a gi