MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation
DGX agentarXiv:2606.17598v2 Announce Type: replace-cross Abstract: Humans naturally leverage diverse sensing modalities to interact with the physical world, while most Vision-Language-Action (VLA) models for r