Audio-Visual Exchange-Aware Token Pruning for Efficient Audio-Visual Captioning
arXiv:2606.10533v1 Announce Type: new Abstract: Audio-visual captioning generates natural language descriptions from video and audio content. Multimodal LLMs have advanced this task, but both modaliti