TY - RPRT TI - Near-Optimal Regret for Adversarial MDP with Delayed Bandit Feedback AU - Tiancheng Jin AU - Tal Lancewicki AU - Haipeng Luo AU - Yishay Mansour AU - Aviv Rosenberg PY - 2023 UR - https://arxiv.org/abs/2201.13172 ID - 2201.13172 ER -