TY - RPRT TI - Efficiently Breaking the Curse of Horizon in Off-Policy Evaluation with Double Reinforcement Learning AU - Nathan Kallus AU - Masatoshi Uehara PY - 2023 UR - https://arxiv.org/abs/1909.05850 ID - 1909.05850 ER -