TY - RPRT TI - Regret Analysis of a Markov Policy Gradient Algorithm for Multi-arm Bandits AU - Denis Denisov AU - Neil Walton PY - 2021 UR - https://arxiv.org/abs/2007.10229 ID - 2007.10229 ER -