TY - RPRT TI - S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning AU - Ruotian Ma AU - Peisong Wang AU - Cheng Liu AU - Xingyan Liu AU - Jiaqi Chen AU - Bang Zhang AU - Xin Zhou AU - Nan Du AU - Jia Li PY - 2025 UR - https://arxiv.org/abs/2502.12853 ID - 2502.12853 ER -