@misc{indiciaef72531a68b84, title = {Towards Robust LLM Post-Training: Automatic Failure Management for Reinforcement Fine-Tuning}, author = {Lingzhe Zhang and Tong Jia and Yunpeng Zhai and Liancheng Fang and Kening Zheng and Hongyi Liu and Xiaosong Huang and Philip S. Yu and Ying Li}, year = {2026}, url = {https://arxiv.org/abs/2605.04431}, note = {Source identifier: 2605.04431} }