TY - RPRT TI - Proximal Gradient Temporal Difference Learning: Stable Reinforcement Learning with Polynomial Sample Complexity AU - Bo Liu AU - Ian Gemp AU - Mohammad Ghavamzadeh AU - Ji Liu AU - Sridhar Mahadevan AU - Marek Petrik PY - 2020 UR - https://arxiv.org/abs/2006.03976 ID - 2006.03976 ER -