TY - RPRT TI - On the model-based stochastic value gradient for continuous reinforcement learning AU - Brandon Amos AU - Samuel Stanton AU - Denis Yarats AU - Andrew Gordon Wilson PY - 2021 UR - https://arxiv.org/abs/2008.12775 ID - 2008.12775 ER -