TY - RPRT TI - Contextual Bandit Learning with Predictable Rewards AU - Alekh Agarwal AU - Miroslav Dudík AU - Satyen Kale AU - John Langford AU - Robert E. Schapire PY - 2012 UR - https://arxiv.org/abs/1202.1334 ID - 1202.1334 ER -