@misc{indiciae8ded0f75bb5c, title = {Guided Dialog Policy Learning: Reward Estimation for Multi-Domain Task-Oriented Dialog}, author = {Ryuichi Takanobu and Hanlin Zhu and Minlie Huang}, year = {2019}, url = {https://arxiv.org/abs/1908.10719}, note = {Source identifier: 1908.10719} }