TY - RPRT TI - Compatible Value Gradients for Reinforcement Learning of Continuous Deep Policies AU - David Balduzzi AU - Muhammad Ghifary PY - 2015 UR - https://arxiv.org/abs/1509.03005 ID - 1509.03005 ER -