@misc{indiciaed65386086258, title = {Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning}, author = {Kai Ye and Hongyi Zhou and Jin Zhu and Francesco Quinzan and Chengchun Shi}, year = {2026}, url = {https://arxiv.org/abs/2504.03784}, note = {Source identifier: 2504.03784} }