Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation
arXiv:2607.07608v1 Announce Type: cross Abstract: Mainstream Vision-Language-Action (VLA) models predict actions primarily from the current observation under a Markovian assumption, thus struggling wi