TY - RPRT TI - Minimax Weight and Q-Function Learning for Off-Policy Evaluation AU - Masatoshi Uehara AU - Jiawei Huang AU - Nan Jiang PY - 2020 UR - https://arxiv.org/abs/1910.12809 ID - 1910.12809 ER -