Bagpiper: Solving Open-Ended Audio Tasks via Rich Captions
DGX agentarXiv:2602.05220v4 Announce Type: replace Abstract: Current audio foundation models typically rely on rigid, task-specific supervision (e.g., speech recognition), addressing isolated factors of audio