TY - RPRT TI - Reward-aware Preference Optimization: A Unified Mathematical Framework for Model Alignment AU - Shengyang Sun AU - Yian Zhang AU - Alexander Bukharin AU - David Mosallanezhad AU - Jiaqi Zeng AU - Soumye Singhal AU - Gerald Shen AU - Adithya Renduchintala AU - Tugrul Konuk AU - Yi Dong AU - Zhilin Wang AU - Dmitry Chichkov AU - Olivier Delalleau AU - Oleksii Kuchaiev PY - 2025 UR - https://arxiv.org/abs/2502.00203 ID - 2502.00203 ER -