@misc{indiciae1f4d4b5aa121, title = {Planner-R1: Reward Shaping Enables Efficient Agentic RL with Smaller LLMs}, author = {Siyu Zhu and Yanbin Jiang and Hejian Sang and Shao Tang and Qingquan Song and Biao He and Rohit Jain and Zhipeng Wang and Alborz Geramifard}, year = {2025}, url = {https://arxiv.org/abs/2509.25779}, note = {Source identifier: 2509.25779} }