TY - RPRT TI - Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning AU - Wu Fei AU - Shuxian Liang AU - Yibo Yang AU - Yang Lin AU - Jing Tang AU - Lei Chen AU - Xiansheng Hua AU - Hao Kong PY - 2026 UR - https://arxiv.org/abs/2507.01551 ID - 2507.01551 ER -