EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs
DGX agentarXiv:2512.10324v2 Announce Type: replace Abstract: Audio-Visual Large Language Models (AV-LLMs) face prohibitive computational costs of processing massive, redundant audio-visual tokens. Existing uni