TY - RPRT TI - Learning Infinite-Horizon Average-Reward Linear Mixture MDPs of Bounded Span AU - Woojin Chae AU - Kihyuk Hong AU - Yufan Zhang AU - Ambuj Tewari AU - Dabeen Lee PY - 2024 UR - https://arxiv.org/abs/2410.14992 ID - 2410.14992 ER -