TY - RPRT TI - DISPO: Enhancing Training Efficiency and Stability in Reinforcement Learning for Large Language Model Mathematical Reasoning AU - Batuhan K. Karaman AU - Aditya Rawal AU - Suhaila Shakiah AU - Mohammad Ghavamzadeh AU - Mingyi Hong AU - Arijit Biswas AU - Ruida Zhou PY - 2026 UR - https://arxiv.org/abs/2602.00983 ID - 2602.00983 ER -