TY - RPRT TI - Safe RLHF: Safe Reinforcement Learning from Human Feedback AU - Josef Dai AU - Xuehai Pan AU - Ruiyang Sun AU - Jiaming Ji AU - Xinbo Xu AU - Mickel Liu AU - Yizhou Wang AU - Yaodong Yang PY - 2023 UR - https://arxiv.org/abs/2310.12773 ID - 2310.12773 ER -