TY - RPRT TI - Soft Policy Gradient Method for Maximum Entropy Deep Reinforcement Learning AU - Wenjie Shi AU - Shiji Song AU - Cheng Wu PY - 2019 UR - https://arxiv.org/abs/1909.03198 ID - 1909.03198 ER -