TY - RPRT TI - Learning from an Exploring Demonstrator: Optimal Reward Estimation for Bandits AU - Wenshuo Guo AU - Kumar Krishna Agrawal AU - Aditya Grover AU - Vidya Muthukumar AU - Ashwin Pananjady PY - 2022 UR - https://arxiv.org/abs/2106.14866 ID - 2106.14866 ER -