TY - RPRT TI - Learning Gaussian Policies from Corrective Human Feedback AU - Daan Wout AU - Jan Scholten AU - Carlos Celemin AU - Jens Kober PY - 2019 UR - https://arxiv.org/abs/1903.05216 ID - 1903.05216 ER -