TY - RPRT TI - Towards Robust LLM Post-Training: Automatic Failure Management for Reinforcement Fine-Tuning AU - Lingzhe Zhang AU - Tong Jia AU - Yunpeng Zhai AU - Liancheng Fang AU - Kening Zheng AU - Hongyi Liu AU - Xiaosong Huang AU - Philip S. Yu AU - Ying Li PY - 2026 UR - https://arxiv.org/abs/2605.04431 ID - 2605.04431 ER -