TY - RPRT TI - Variance-Dependent Regret Bounds for Linear Bandits and Reinforcement Learning: Adaptivity and Computational Efficiency AU - Heyang Zhao AU - Jiafan He AU - Dongruo Zhou AU - Tong Zhang AU - Quanquan Gu PY - 2023 UR - https://arxiv.org/abs/2302.10371 ID - 2302.10371 ER -