TY - RPRT TI - Provably Efficient Reinforcement Learning via Surprise Bound AU - Hanlin Zhu AU - Ruosong Wang AU - Jason D. Lee PY - 2023 UR - https://arxiv.org/abs/2302.11634 ID - 2302.11634 ER -