@misc{indiciaefe0e56b6766e, title = {PARL: A Unified Framework for Policy Alignment in Reinforcement Learning from Human Feedback}, author = {Souradip Chakraborty and Amrit Singh Bedi and Alec Koppel and Dinesh Manocha and Huazheng Wang and Mengdi Wang and Furong Huang}, year = {2024}, url = {https://arxiv.org/abs/2308.02585}, note = {Source identifier: 2308.02585} }