TY - RPRT TI - Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models AU - Yawen Shao AU - Jie Xiao AU - Kai Zhu AU - Yu Liu AU - Hongchen Luo AU - Xueyang Fu AU - Yang Cao AU - Wei Zhai AU - Zheng-Jun Zha PY - 2026 UR - https://arxiv.org/abs/2606.08501 ID - 2606.08501 ER -