TY - RPRT TI - On Designing Effective RL Reward at Training Time for LLM Reasoning AU - Jiaxuan Gao AU - Shusheng Xu AU - Wenjie Ye AU - Weilin Liu AU - Chuyi He AU - Wei Fu AU - Zhiyu Mei AU - Guangju Wang AU - Yi Wu PY - 2024 UR - https://arxiv.org/abs/2410.15115 ID - 2410.15115 ER -