TY - RPRT TI - Doubly Robust Off-policy Value Evaluation for Reinforcement Learning AU - Nan Jiang AU - Lihong Li PY - 2016 UR - https://arxiv.org/abs/1511.03722 ID - 1511.03722 ER -