Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models
DGX agentarXiv:2605.25820v1 Announce Type: new Abstract: Diffusion-based multimodal large language models (dMLLMs) decode by iteratively predicting tokens at multiple masked positions in parallel. This turns e