TY - RPRT TI - UDQL: Bridging The Gap between MSE Loss and The Optimal Value Function in Offline Reinforcement Learning AU - Yu Zhang AU - Rui Yu AU - Zhipeng Yao AU - Wenyuan Zhang AU - Jun Wang AU - Liming Zhang PY - 2024 UR - https://arxiv.org/abs/2406.03324 ID - 2406.03324 ER -