TY - RPRT TI - Logarithmic regret for episodic continuous-time linear-quadratic reinforcement learning over a finite-time horizon AU - Matteo Basei AU - Xin Guo AU - Anran Hu AU - Yufei Zhang PY - 2022 UR - https://arxiv.org/abs/2006.15316 ID - 2006.15316 ER -