TY - RPRT TI - Learning from the Irrecoverable: Error-Localized Policy Optimization for Tool-Integrated LLM Reasoning AU - Qiao Liang AU - Yuke Zhu AU - Chao Ge AU - Lei Yang AU - Ying Shen AU - Bo Zheng AU - Sheng Guo PY - 2026 UR - https://arxiv.org/abs/2602.09598 ID - 2602.09598 ER -