Persistent Object Narratives for Token-Efficient Video Language Models
arXiv:2608.04866v1 Announce Type: new Abstract: Video large language models (Video-LLMs) have made strong progress in open-ended video understanding. However, their visual interfaces remain token-inte