TY - RPRT TI - R1-Code-Interpreter: LLMs Reason with Code via Supervised and Multi-stage Reinforcement Learning AU - Yongchao Chen AU - Yueying Liu AU - Junwei Zhou AU - Yilun Hao AU - Jingquan Wang AU - Yang Zhang AU - Na Li AU - Chuchu Fan PY - 2026 UR - https://arxiv.org/abs/2505.21668 ID - 2505.21668 ER -