TY - RPRT TI - Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents: A Comprehensive Recipe AU - Xixi Wu AU - Qianguo Sun AU - Ruiyang Zhang AU - Chao Song AU - Junlong Wu AU - Yiyan Qi AU - Hong Cheng PY - 2026 UR - https://arxiv.org/abs/2603.21972 ID - 2603.21972 ER -