@misc{indiciae35ac9ded1c4d, title = {Batch Reinforcement Learning with a Nonparametric Off-Policy Policy Gradient}, author = {Samuele Tosatto and João Carvalho and Jan Peters}, year = {2021}, url = {https://arxiv.org/abs/2010.14771}, note = {Source identifier: 2010.14771} }