@misc{indiciae9e5bf4786721, title = {Approximate Temporal Difference Learning is a Gradient Descent for Reversible Policies}, author = {Yann Ollivier}, year = {2018}, url = {https://arxiv.org/abs/1805.00869}, note = {Source identifier: 1805.00869} }