Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs
DGX agentarXiv:2608.08794v1 Announce Type: new Abstract: Omni-modal LLMs jointly process audio, video, and text, but long multimodal sequences incur substantial prefill and KV-cache costs. Existing omni-modal