TY - RPRT TI - Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes AU - Nathan Kallus AU - Masatoshi Uehara PY - 2020 UR - https://arxiv.org/abs/1908.08526 ID - 1908.08526 ER -