@misc{indiciaedbd0f324e784, title = {HRLAIF: Improvements in Helpfulness and Harmlessness in Open-domain Reinforcement Learning From AI Feedback}, author = {Ang Li and Qiugen Xiao and Peng Cao and Jian Tang and Yi Yuan and Zijie Zhao and Xiaoyuan Chen and Liang Zhang and Xiangyang Li and Kaitong Yang and Weidong Guo and Yukang Gan and Xu Yu and Daniell Wang and Ying Shan}, year = {2024}, url = {https://arxiv.org/abs/2403.08309}, note = {Source identifier: 2403.08309} }