TY - RPRT TI - Stabilizing Off-Policy Q-Learning via Bootstrapping Error Reduction AU - Aviral Kumar AU - Justin Fu AU - George Tucker AU - Sergey Levine PY - 2019 UR - https://arxiv.org/abs/1906.00949 ID - 1906.00949 ER -