TY - RPRT TI - Taming Masked Diffusion Language Models via Consistency Trajectory Reinforcement Learning with Fewer Decoding Step AU - Jingyi Yang AU - Guanxu Chen AU - Xuhao Hu AU - Jing Shao PY - 2025 UR - https://arxiv.org/abs/2509.23924 ID - 2509.23924 ER -