TY - RPRT TI - On Multi-objective Policy Optimization as a Tool for Reinforcement Learning: Case Studies in Offline RL and Finetuning AU - Abbas Abdolmaleki AU - Sandy H. Huang AU - Giulia Vezzani AU - Bobak Shahriari AU - Jost Tobias Springenberg AU - Shruti Mishra AU - Dhruva TB AU - Arunkumar Byravan AU - Konstantinos Bousmalis AU - Andras Gyorgy AU - Csaba Szepesvari AU - Raia Hadsell AU - Nicolas Heess AU - Martin Riedmiller PY - 2023 UR - https://arxiv.org/abs/2106.08199 ID - 2106.08199 ER -