LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning
DGX agentarXiv:2601.10129v2 Announce Type: replace-cross Abstract: Current multimodal latent reasoning often relies on external supervision (e.g., auxiliary images), ignoring intrinsic visual attention dynamic