TY - RPRT TI - From Self-Evolving Synthetic Data to Verifiable-Reward RL: Post-Training Multi-turn Interactive Tool-Using Agents AU - Jiaxuan Gao AU - Jiaao Chen AU - Chuyi He AU - Shusheng Xu AU - Di Jin AU - Yi Wu PY - 2026 UR - https://arxiv.org/abs/2601.22607 ID - 2601.22607 ER -