TY - RPRT TI - PARL: A Unified Framework for Policy Alignment in Reinforcement Learning from Human Feedback AU - Souradip Chakraborty AU - Amrit Singh Bedi AU - Alec Koppel AU - Dinesh Manocha AU - Huazheng Wang AU - Mengdi Wang AU - Furong Huang PY - 2024 UR - https://arxiv.org/abs/2308.02585 ID - 2308.02585 ER -