Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies
arXiv:2602.06575v2 Announce Type: replace-cross Abstract: Vision-language-action (VLA) models typically inject proprioception only as a late conditioning signal, preventing robot state from grounding