Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment
DGX agentarXiv:2607.13429v1 Announce Type: cross Abstract: Finetuning a pretrained vision-language model (VLM) on robot demonstrations via behavior cloning (BC) has become the standard recipe for vision-langua