TY - RPRT TI - Towards a Sharp Analysis of Offline Policy Learning for $f$-Divergence-Regularized Contextual Bandits AU - Qingyue Zhao AU - Kaixuan Ji AU - Heyang Zhao AU - Tong Zhang AU - Quanquan Gu PY - 2026 UR - https://arxiv.org/abs/2502.06051 ID - 2502.06051 ER -