TY - RPRT TI - Provable Model-based Nonlinear Bandit and Reinforcement Learning: Shelve Optimism, Embrace Virtual Curvature AU - Kefan Dong AU - Jiaqi Yang AU - Tengyu Ma PY - 2022 UR - https://arxiv.org/abs/2102.04168 ID - 2102.04168 ER -