TY - RPRT TI - Robust Reinforcement Learning from Corrupted Human Feedback AU - Alexander Bukharin AU - Ilgee Hong AU - Haoming Jiang AU - Zichong Li AU - Qingru Zhang AU - Zixuan Zhang AU - Tuo Zhao PY - 2024 UR - https://arxiv.org/abs/2406.15568 ID - 2406.15568 ER -