TY - RPRT TI - Tackling Heavy-Tailed Rewards in Reinforcement Learning with Function Approximation: Minimax Optimal and Instance-Dependent Regret Bounds AU - Jiayi Huang AU - Han Zhong AU - Liwei Wang AU - Lin F. Yang PY - 2024 UR - https://arxiv.org/abs/2306.06836 ID - 2306.06836 ER -