AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models
DGX agentarXiv:2605.25901v1 Announce Type: cross Abstract: 3D Visual Grounding (3DVG) is an essential capability for embodied AI, requiring agents to localize objects in 3D scenes based on natural language des