TY - RPRT TI - A Hybrid Stochastic Policy Gradient Algorithm for Reinforcement Learning AU - Nhan H. Pham AU - Lam M. Nguyen AU - Dzung T. Phan AU - Phuong Ha Nguyen AU - Marten van Dijk AU - Quoc Tran-Dinh PY - 2020 UR - https://arxiv.org/abs/2003.00430 ID - 2003.00430 ER -