TY - RPRT TI - Policy Gradient Methods for Reinforcement Learning with Function Approximation and Action-Dependent Baselines AU - Philip S. Thomas AU - Emma Brunskill PY - 2017 UR - https://arxiv.org/abs/1706.06643 ID - 1706.06643 ER -