TY - RPRT TI - DR3: Value-Based Deep Reinforcement Learning Requires Explicit Regularization AU - Aviral Kumar AU - Rishabh Agarwal AU - Tengyu Ma AU - Aaron Courville AU - George Tucker AU - Sergey Levine PY - 2021 UR - https://arxiv.org/abs/2112.04716 ID - 2112.04716 ER -