TY - RPRT TI - Optimistic Regret Bounds for Online Learning in Adversarial Markov Decision Processes AU - Sang Bin Moon AU - Abolfazl Hashemi PY - 2024 UR - https://arxiv.org/abs/2405.02188 ID - 2405.02188 ER -