TY - RPRT TI - Variance-Aware Fine-Grained Gap-Dependent Bounds for Online Reinforcement Learning AU - Haochen Zhang AU - Lingzhou Xue AU - Zhong Zheng PY - 2026 UR - https://arxiv.org/abs/2610.04752 ID - 2610.04752 ER -