TY - RPRT TI - Reinforcement Learning Using Expectation Maximization Based Guided Policy Search for Stochastic Dynamics AU - Prakash Mallick AU - Zhiyong Chen AU - Mohsen Zamani PY - 2020 UR - https://arxiv.org/abs/2010.00304 ID - 2010.00304 ER -