TY - RPRT TI - Reinforcement Learning for Reasoning in Large Language Models with One Training Example AU - Yiping Wang AU - Qing Yang AU - Zhiyuan Zeng AU - Liliang Ren AU - Liyuan Liu AU - Baolin Peng AU - Hao Cheng AU - Xuehai He AU - Kuan Wang AU - Jianfeng Gao AU - Weizhu Chen AU - Shuohang Wang AU - Simon Shaolei Du AU - Yelong Shen PY - 2025 UR - https://arxiv.org/abs/2504.20571 ID - 2504.20571 ER -