TY - RPRT TI - MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use AU - Weikang Zhao AU - Xili Wang AU - Chengdi Ma AU - Lingbin Kong AU - Zhaohua Yang AU - Mingxiang Tuo AU - Xiaowei Shi AU - Yitao Zhai AU - Xunliang Cai PY - 2025 UR - https://arxiv.org/abs/2508.18669 ID - 2508.18669 ER -