@misc{indiciae81ada0af76c8, title = {Beyond Correctness: Harmonizing Process and Outcome Rewards through RL Training}, author = {Chenlu Ye and Zhou Yu and Ziji Zhang and Hao Chen and Narayanan Sadagopan and Jing Huang and Tong Zhang and Anurag Beniwal}, year = {2026}, url = {https://arxiv.org/abs/2509.03403}, note = {Source identifier: 2509.03403} }