TY - RPRT TI - Optimal and Adaptive Off-policy Evaluation in Contextual Bandits AU - Yu-Xiang Wang AU - Alekh Agarwal AU - Miroslav Dudik PY - 2017 UR - https://arxiv.org/abs/1612.01205 ID - 1612.01205 ER -