@misc{indiciae01a74c01201f, title = {Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning}, author = {Wu Fei and Shuxian Liang and Yibo Yang and Yang Lin and Jing Tang and Lei Chen and Xiansheng Hua and Hao Kong}, year = {2026}, url = {https://arxiv.org/abs/2507.01551}, note = {Source identifier: 2507.01551} }