TY - RPRT TI - Reward Model Learning vs. Direct Policy Optimization: A Comparative Analysis of Learning from Human Preferences AU - Andi Nika AU - Debmalya Mandal AU - Parameswaran Kamalaruban AU - Georgios Tzannetos AU - Goran Radanović AU - Adish Singla PY - 2024 UR - https://arxiv.org/abs/2403.01857 ID - 2403.01857 ER -