TY - RPRT TI - Full-Step-DPO: Self-Supervised Preference Optimization with Step-wise Rewards for Mathematical Reasoning AU - Huimin Xu AU - Xin Mao AU - Feng-Lin Li AU - Xiaobao Wu AU - Wang Chen AU - Wei Zhang AU - Anh Tuan Luu PY - 2025 UR - https://arxiv.org/abs/2502.14356 ID - 2502.14356 ER -