TY - RPRT TI - Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog AU - Natasha Jaques AU - Asma Ghandeharioun AU - Judy Hanwen Shen AU - Craig Ferguson AU - Agata Lapedriza AU - Noah Jones AU - Shixiang Gu AU - Rosalind Picard PY - 2019 UR - https://arxiv.org/abs/1907.00456 ID - 1907.00456 ER -