@misc{indiciaef9cffcf80152, title = {A Model-free Learning Algorithm for Infinite-horizon Average-reward MDPs with Near-optimal Regret}, author = {Mehdi Jafarnia-Jahromi and Chen-Yu Wei and Rahul Jain and Haipeng Luo}, year = {2020}, url = {https://arxiv.org/abs/2006.04354}, note = {Source identifier: 2006.04354} }