DAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language Models
DGX agentarXiv:2608.01821v1 Announce Type: new Abstract: Diffusion vision-language models (dVLMs) iteratively denoise masked responses while conditioning each denoising step on visual evidence, making visual c