TY - RPRT TI - A Minimax Learning Approach to Off-Policy Evaluation in Confounded Partially Observable Markov Decision Processes AU - Chengchun Shi AU - Masatoshi Uehara AU - Jiawei Huang AU - Nan Jiang PY - 2022 UR - https://arxiv.org/abs/2111.06784 ID - 2111.06784 ER -