TY - RPRT TI - Tail Distribution of Regret in Optimistic Reinforcement Learning AU - Sajad Khodadadian AU - Mehrdad Moharrami PY - 2026 UR - https://arxiv.org/abs/2511.18247 ID - 2511.18247 ER -