TY - RPRT TI - Reinforcement Learning for Non-Stationary Markov Decision Processes: The Blessing of (More) Optimism AU - Wang Chi Cheung AU - David Simchi-Levi AU - Ruihao Zhu PY - 2020 UR - https://arxiv.org/abs/2006.14389 ID - 2006.14389 ER -