TY - RPRT TI - SeRL: Self-Play Reinforcement Learning for Large Language Models with Limited Data AU - Wenkai Fang AU - Shunyu Liu AU - Yang Zhou AU - Kongcheng Zhang AU - Tongya Zheng AU - Kaixuan Chen AU - Mingli Song AU - Dacheng Tao PY - 2026 UR - https://arxiv.org/abs/2505.20347 ID - 2505.20347 ER -