@misc{indiciae225330f29467, title = {Policy Gradient Methods for Reinforcement Learning with Function Approximation and Action-Dependent Baselines}, author = {Philip S. Thomas and Emma Brunskill}, year = {2017}, url = {https://arxiv.org/abs/1706.06643}, note = {Source identifier: 1706.06643} }