TY - RPRT TI - Towards Optimal Off-Policy Evaluation for Reinforcement Learning with Marginalized Importance Sampling AU - Tengyang Xie AU - Yifei Ma AU - Yu-Xiang Wang PY - 2020 UR - https://arxiv.org/abs/1906.03393 ID - 1906.03393 ER -