LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning
DGX agentarXiv:2605.22012v1 Announce Type: new Abstract: Joint audio-visual reasoning is essential for omnimodal understanding, yet current multimodal large language models (MLLMs) still struggle when reasonin