TY - RPRT TI - Sample-efficient Actor-Critic Reinforcement Learning with Supervised Data for Dialogue Management AU - Pei-Hao Su AU - Pawel Budzianowski AU - Stefan Ultes AU - Milica Gasic AU - Steve Young PY - 2017 UR - https://arxiv.org/abs/1707.00130 ID - 1707.00130 ER -