TY - RPRT TI - Policy Gradient for Continuing Tasks in Non-stationary Markov Decision Processes AU - Santiago Paternain AU - Juan Andres Bazerque AU - Alejandro Ribeiro PY - 2020 UR - https://arxiv.org/abs/2010.08443 ID - 2010.08443 ER -