TY - RPRT TI - A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions AU - Zhiyin Yu AU - Yuchen Mou AU - Juncheng Yan AU - Junyu Luo AU - Chunchun Chen AU - Xing Wei AU - Yunhui Liu AU - Hongru Sun AU - Yuxing Zhang AU - Jun Xu AU - Yatao Bian AU - Ming Zhang AU - Wei Ye AU - Tieke He AU - Jie Yang AU - Guanjie Zheng AU - Zhonghai Wu AU - Bo Zhang AU - Lei Bai AU - Xiao Luo PY - 2026 UR - https://arxiv.org/abs/2604.17312 ID - 2604.17312 ER -