TY - RPRT TI - Utility-inspired Reward Transformations Improve Reinforcement Learning Training of Language Models AU - Roberto-Rafael Maura-Rivero AU - Chirag Nagpal AU - Roma Patel AU - Francesco Visin PY - 2025 UR - https://arxiv.org/abs/2501.06248 ID - 2501.06248 ER -