TY - RPRT TI - SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning AU - Yihao Liu AU - Shuocheng Li AU - Lang Cao AU - Yuhang Xie AU - Mengyu Zhou AU - Haoyu Dong AU - Xiaojun Ma AU - Shi Han AU - Dongmei Zhang PY - 2025 UR - https://arxiv.org/abs/2506.01096 ID - 2506.01096 ER -