TY - RPRT TI - A Q-learning algorithm for discrete-time linear-quadratic control with random parameters of unknown distribution: convergence and stabilization AU - Kai Du AU - Qingxin Meng AU - Fu Zhang PY - 2020 UR - https://arxiv.org/abs/2011.04970 ID - 2011.04970 ER -