TY - RPRT TI - Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning AU - Kai Ye AU - Hongyi Zhou AU - Jin Zhu AU - Francesco Quinzan AU - Chengchun Shi PY - 2026 UR - https://arxiv.org/abs/2504.03784 ID - 2504.03784 ER -