TY - RPRT TI - Q-Learning with Shift-Aware Upper Confidence Bound in Non-Stationary Reinforcement Learning AU - Ha Manh Bui AU - Felix Parker AU - Kimia Ghobadi AU - Anqi Liu PY - 2026 UR - https://arxiv.org/abs/2510.03181 ID - 2510.03181 ER -