TY - RPRT TI - Learning Reward and Policy Jointly from Demonstration and Preference Improves Alignment AU - Chenliang Li AU - Siliang Zeng AU - Zeyi Liao AU - Jiaxiang Li AU - Dongyeop Kang AU - Alfredo Garcia AU - Mingyi Hong PY - 2024 UR - https://arxiv.org/abs/2406.06874 ID - 2406.06874 ER -