TY - RPRT TI - SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents AU - Ziyi Wang AU - Yuxuan Lu AU - Yimeng Zhang AU - Qun Liu AU - Chen Luo AU - Jiri Gesi AU - Hanqing Lu AU - Yisi Sang AU - Manling Li AU - Jing Huang AU - Dakuo Wang PY - 2026 UR - https://arxiv.org/abs/2606.12908 ID - 2606.12908 ER -