TY - RPRT TI - DiFFPO: Training Diffusion LLMs to Reason Fast and Furious via Reinforcement Learning AU - Hanyang Zhao AU - Dawen Liang AU - Wenpin Tang AU - David Yao AU - Nathan Kallus PY - 2026 UR - https://arxiv.org/abs/2510.02212 ID - 2510.02212 ER -