TY - RPRT TI - Distributional Soft Actor-Critic: Off-Policy Reinforcement Learning for Addressing Value Estimation Errors AU - Jingliang Duan AU - Yang Guan AU - Shengbo Eben Li AU - Yangang Ren AU - Bo Cheng PY - 2021 DO - 10.1109/tnnls.2021.3082568 UR - https://arxiv.org/abs/2001.02811 ID - 2001.02811 ER -