TY - RPRT TI - On-line Active Reward Learning for Policy Optimisation in Spoken Dialogue Systems AU - Pei-Hao Su AU - Milica Gasic AU - Nikola Mrksic AU - Lina Rojas-Barahona AU - Stefan Ultes AU - David Vandyke AU - Tsung-Hsien Wen AU - Steve Young PY - 2016 UR - https://arxiv.org/abs/1605.07669 ID - 1605.07669 ER -