TY - RPRT TI - Transforming and Combining Rewards for Aligning Large Language Models AU - Zihao Wang AU - Chirag Nagpal AU - Jonathan Berant AU - Jacob Eisenstein AU - Alex D'Amour AU - Sanmi Koyejo AU - Victor Veitch PY - 2024 UR - https://arxiv.org/abs/2402.00742 ID - 2402.00742 ER -