@misc{indiciaeab92c8047ede, title = {On Designing Effective RL Reward at Training Time for LLM Reasoning}, author = {Jiaxuan Gao and Shusheng Xu and Wenjie Ye and Weilin Liu and Chuyi He and Wei Fu and Zhiyu Mei and Guangju Wang and Yi Wu}, year = {2024}, url = {https://arxiv.org/abs/2410.15115}, note = {Source identifier: 2410.15115} }