TY - RPRT TI - Data-Efficient Off-Policy Policy Evaluation for Reinforcement Learning AU - Philip S. Thomas AU - Emma Brunskill PY - 2016 UR - https://arxiv.org/abs/1604.00923 ID - 1604.00923 ER -