GemNav: Discrete-Token Visual Robot Navigation using a Multimodal Large Language Model
DGX agentarXiv:2607.06882v1 Announce Type: cross Abstract: Visual navigation policies built on large pretrained models have so far followed a common recipe: a dedicated visual encoder, a bespoke action head, a