TY - RPRT TI - Self-Rewarding Sequential Monte Carlo for Masked Diffusion Language Models AU - Ziwei Luo AU - Ziqi Jin AU - Lei Wang AU - Lidong Bing AU - Thomas B. Schön PY - 2026 UR - https://arxiv.org/abs/2602.01849 ID - 2602.01849 ER -