SpectCount: Spectrotemporal Counting via Synthetic Signals Improves Large Audio Language Models
DGX agentarXiv:2606.06907v1 Announce Type: cross Abstract: Large audio language models (LALMs) extend large language models with an audio encoder and large-scale audio data. However, the scarcity of high-quali