Reconsidering Positional Supervision in Masked Diffusion Language Model Training
DGX agentarXiv:2601.22947v2 Announce Type: replace Abstract: Masked diffusion language models (MDLMs) generate text by unmasking tokens in parallel and have recently emerged as alternatives to autoregressive l