TY - RPRT TI - Training Task Reasoning LLM Agents for Multi-turn Task Planning via Single-turn Reinforcement Learning AU - Hanjiang Hu AU - Changliu Liu AU - Na Li AU - Yebin Wang PY - 2025 UR - https://arxiv.org/abs/2509.20616 ID - 2509.20616 ER -