@misc{indiciaede0621e2aa07, title = {COPR: Continual Human Preference Learning via Optimal Policy Regularization}, author = {Han Zhang and Lin Gui and Yu Lei and Yuanzhao Zhai and Yehong Zhang and Yulan He and Hui Wang and Yue Yu and Kam-Fai Wong and Bin Liang and Ruifeng Xu}, year = {2024}, url = {https://arxiv.org/abs/2402.14228}, note = {Source identifier: 2402.14228} }