TY - RPRT TI - COPR: Continual Human Preference Learning via Optimal Policy Regularization AU - Han Zhang AU - Lin Gui AU - Yu Lei AU - Yuanzhao Zhai AU - Yehong Zhang AU - Yulan He AU - Hui Wang AU - Yue Yu AU - Kam-Fai Wong AU - Bin Liang AU - Ruifeng Xu PY - 2024 UR - https://arxiv.org/abs/2402.14228 ID - 2402.14228 ER -