HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control
DGX agentarXiv:2607.03449v1 Announce Type: cross Abstract: Current Vision-Language-Action (VLA) models excel at robotic manipulation but often struggle with non-Markovian tasks requiring long-term memory and r