TY - RPRT TI - Asymptotically Efficient Off-Policy Evaluation for Tabular Reinforcement Learning AU - Ming Yin AU - Yu-Xiang Wang PY - 2020 UR - https://arxiv.org/abs/2001.10742 ID - 2001.10742 ER -