TY - RPRT TI - Beyond Value-Function Gaps: Improved Instance-Dependent Regret Bounds for Episodic Reinforcement Learning AU - Christoph Dann AU - Teodor V. Marinov AU - Mehryar Mohri AU - Julian Zimmert PY - 2021 UR - https://arxiv.org/abs/2107.01264 ID - 2107.01264 ER -