TY - RPRT TI - Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization AU - Yu Li AU - Sizhe Tang AU - Tian Lan PY - 2026 UR - https://arxiv.org/abs/2604.07165 ID - 2604.07165 ER -