TY - RPRT TI - Meta-Learning Bandit Policies by Gradient Ascent AU - Branislav Kveton AU - Martin Mladenov AU - Chih-Wei Hsu AU - Manzil Zaheer AU - Csaba Szepesvari AU - Craig Boutilier PY - 2021 UR - https://arxiv.org/abs/2006.05094 ID - 2006.05094 ER -