TY - RPRT TI - Stabilizing Reinforcement Learning for Diffusion Language Models AU - Jianyuan Zhong AU - Kaibo Wang AU - Ding Ding AU - Zijin Feng AU - Haoli Bai AU - Yang Xiang AU - Jiacheng Sun AU - Qiang Xu PY - 2026 UR - https://arxiv.org/abs/2603.06743 ID - 2603.06743 ER -