TY - RPRT TI - Intrinsically Efficient, Stable, and Bounded Off-Policy Evaluation for Reinforcement Learning AU - Nathan Kallus AU - Masatoshi Uehara PY - 2019 UR - https://arxiv.org/abs/1906.03735 ID - 1906.03735 ER -