TY - RPRT TI - Pessimistic Value Iteration for Multi-Task Data Sharing in Offline Reinforcement Learning AU - Chenjia Bai AU - Lingxiao Wang AU - Jianye Hao AU - Zhuoran Yang AU - Bin Zhao AU - Zhen Wang AU - Xuelong Li PY - 2024 DO - 10.1016/j.artint.2023.104048 UR - https://arxiv.org/abs/2404.19346 ID - 2404.19346 ER -