TY - RPRT TI - Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning AU - Zhiheng Xi AU - Wenxiang Chen AU - Boyang Hong AU - Senjie Jin AU - Rui Zheng AU - Wei He AU - Yiwen Ding AU - Shichun Liu AU - Xin Guo AU - Junzhe Wang AU - Honglin Guo AU - Wei Shen AU - Xiaoran Fan AU - Yuhao Zhou AU - Shihan Dou AU - Xiao Wang AU - Xinbo Zhang AU - Peng Sun AU - Tao Gui AU - Qi Zhang AU - Xuanjing Huang PY - 2024 UR - https://arxiv.org/abs/2402.05808 ID - 2402.05808 ER -