TY - RPRT TI - SPPD: Self-training with Process Preference Learning Using Dynamic Value Margin AU - Hao Yi AU - Qingyang Li AU - Yulan Hu AU - Fuzheng Zhang AU - Di Zhang AU - Yong Liu PY - 2025 UR - https://arxiv.org/abs/2502.13516 ID - 2502.13516 ER -