@misc{indiciae4e0e43249116, title = {Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models}, author = {Yawen Shao and Jie Xiao and Kai Zhu and Yu Liu and Hongchen Luo and Xueyang Fu and Yang Cao and Wei Zhai and Zheng-Jun Zha}, year = {2026}, url = {https://arxiv.org/abs/2606.08501}, note = {Source identifier: 2606.08501} }