Encode Once, Decode Never: Reusing Audio LM Internals for Efficient Temporal Localization
DGX agentarXiv:2602.10230v2 Announce Type: replace Abstract: Audio language models process input audio into rich frame-level representations, but the standard approach to temporal localization generates timest