TY - RPRT TI - A Model-free Learning Algorithm for Infinite-horizon Average-reward MDPs with Near-optimal Regret AU - Mehdi Jafarnia-Jahromi AU - Chen-Yu Wei AU - Rahul Jain AU - Haipeng Luo PY - 2020 UR - https://arxiv.org/abs/2006.04354 ID - 2006.04354 ER -