TY - RPRT TI - PCL-Reasoner-V1.5: Advancing Math Reasoning with Offline Reinforcement Learning AU - Yao Lu AU - Dengdong Fan AU - Jianzheng Nie AU - Fan Xu AU - Jie Chen AU - Bin Zhou AU - Yonghong Tian PY - 2026 UR - https://arxiv.org/abs/2601.14716 ID - 2601.14716 ER -