TY - RPRT TI - Interpolated Policy Gradient: Merging On-Policy and Off-Policy Gradient Estimation for Deep Reinforcement Learning AU - Shixiang Gu AU - Timothy Lillicrap AU - Zoubin Ghahramani AU - Richard E. Turner AU - Bernhard Schölkopf AU - Sergey Levine PY - 2017 UR - https://arxiv.org/abs/1706.00387 ID - 1706.00387 ER -