TY - RPRT TI - Planner-R1: Reward Shaping Enables Efficient Agentic RL with Smaller LLMs AU - Siyu Zhu AU - Yanbin Jiang AU - Hejian Sang AU - Shao Tang AU - Qingquan Song AU - Biao He AU - Rohit Jain AU - Zhipeng Wang AU - Alborz Geramifard PY - 2025 UR - https://arxiv.org/abs/2509.25779 ID - 2509.25779 ER -