TTF: Temporal Token Fusion for Efficient Video-Language Model
arXiv:2605.07355v1 Announce Type: cross Abstract: Video-language models (VLMs) face rapid inference costs as visual token counts scale with video length. For example, 32 frames at 448{imes}448 resolut