TY - RPRT TI - Synthesize and Reward -- Reinforcement Learning for Multi-Step Tool Use in Live Environments AU - Ibrahim Abdelaziz AU - Asim Munawar AU - Kinjal Basu AU - Maxwell Crouse AU - Chulaka Gunasekara AU - Suneet Katrekar AU - Pavan Kapanipathi PY - 2026 UR - https://arxiv.org/abs/2606.03892 ID - 2606.03892 ER -