@misc{indiciae2ec2d92ea4f8, title = {From Self-Evolving Synthetic Data to Verifiable-Reward RL: Post-Training Multi-turn Interactive Tool-Using Agents}, author = {Jiaxuan Gao and Jiaao Chen and Chuyi He and Shusheng Xu and Di Jin and Yi Wu}, year = {2026}, url = {https://arxiv.org/abs/2601.22607}, note = {Source identifier: 2601.22607} }