TY - RPRT TI - Enhancing Safety in Reinforcement Learning with Human Feedback via Rectified Policy Optimization AU - Xiyue Peng AU - Hengquan Guo AU - Jiawei Zhang AU - Dongqing Zou AU - Ziyu Shao AU - Honghao Wei AU - Xin Liu PY - 2025 UR - https://arxiv.org/abs/2410.19933 ID - 2410.19933 ER -