TY - RPRT TI - Ensuring Monotonic Policy Improvement in Entropy-regularized Value-based Reinforcement Learning AU - Lingwei Zhu AU - Takamitsu Matsubara PY - 2020 UR - https://arxiv.org/abs/2008.10806 ID - 2008.10806 ER -