TY - RPRT TI - Variance-Aware Regret Bounds for Undiscounted Reinforcement Learning in MDPs AU - Mohammad Sadegh Talebi AU - Odalric-Ambrym Maillard PY - 2018 UR - https://arxiv.org/abs/1803.01626 ID - 1803.01626 ER -