TY - RPRT TI - Delay-Adapted Policy Optimization and Improved Regret for Adversarial MDP with Delayed Bandit Feedback AU - Tal Lancewicki AU - Aviv Rosenberg AU - Dmitry Sotnikov PY - 2023 UR - https://arxiv.org/abs/2305.07911 ID - 2305.07911 ER -