@misc{indiciaec6af9184119f, title = {Variance-Aware Regret Bounds for Undiscounted Reinforcement Learning in MDPs}, author = {Mohammad Sadegh Talebi and Odalric-Ambrym Maillard}, year = {2018}, url = {https://arxiv.org/abs/1803.01626}, note = {Source identifier: 1803.01626} }