TY - RPRT TI - Conservative Q-Learning for Offline Reinforcement Learning AU - Aviral Kumar AU - Aurick Zhou AU - George Tucker AU - Sergey Levine PY - 2020 UR - https://arxiv.org/abs/2006.04779 ID - 2006.04779 ER -