@misc{indiciae1f779b09459d, title = {Learning Reward and Policy Jointly from Demonstration and Preference Improves Alignment}, author = {Chenliang Li and Siliang Zeng and Zeyi Liao and Jiaxiang Li and Dongyeop Kang and Alfredo Garcia and Mingyi Hong}, year = {2024}, url = {https://arxiv.org/abs/2406.06874}, note = {Source identifier: 2406.06874} }