TY - RPRT TI - Uniform Last-Iterate Guarantee for Bandits and Reinforcement Learning AU - Junyan Liu AU - Yunfan Li AU - Ruosong Wang AU - Lin F. Yang PY - 2024 UR - https://arxiv.org/abs/2402.12711 ID - 2402.12711 ER -