Phoneme-Level Visual Speech Recognition via Point-Visual Fusion and Language Model Reconstruction
DGX agentarXiv:2507.18863v2 Announce Type: replace-cross Abstract: Visual Automatic Speech Recognition (V-ASR) is a challenging task that involves interpreting spoken language solely from visual information, s