TY - RPRT TI - Approximate Temporal Difference Learning is a Gradient Descent for Reversible Policies AU - Yann Ollivier PY - 2018 UR - https://arxiv.org/abs/1805.00869 ID - 1805.00869 ER -