@misc{indiciaeff85dd35faa0, title = {Safe RLHF: Safe Reinforcement Learning from Human Feedback}, author = {Josef Dai and Xuehai Pan and Ruiyang Sun and Jiaming Ji and Xinbo Xu and Mickel Liu and Yizhou Wang and Yaodong Yang}, year = {2023}, url = {https://arxiv.org/abs/2310.12773}, note = {Source identifier: 2310.12773} }