TY - RPRT TI - CM2: Reinforcement Learning with Checklist Rewards for Multi-Turn and Multi-Step Agentic Tool Use AU - Zhen Zhang AU - Kaiqiang Song AU - Xun Wang AU - Yebowen Hu AU - Weixiang Yan AU - Chenyang Zhao AU - Henry Peng Zou AU - Haoyun Deng AU - Sathish Reddy Indurthi AU - Shujian Liu AU - Simin Ma AU - Xiaoyang Wang AU - Xin Eric Wang AU - Song Wang PY - 2026 UR - https://arxiv.org/abs/2602.12268 ID - 2602.12268 ER -