TY - RPRT TI - Policy Optimization Reinforcement Learning with Entropy Regularization AU - Jingbin Liu AU - Xinyang Gu AU - Shuai Liu PY - 2020 UR - https://arxiv.org/abs/1912.01557 ID - 1912.01557 ER -