TY - RPRT TI - Batch Reinforcement Learning with a Nonparametric Off-Policy Policy Gradient AU - Samuele Tosatto AU - João Carvalho AU - Jan Peters PY - 2021 UR - https://arxiv.org/abs/2010.14771 ID - 2010.14771 ER -