@misc{indiciaee510fcc0b451, title = {Reinforcement Learning for Bandit Neural Machine Translation with Simulated Human Feedback}, author = {Khanh Nguyen and Hal Daumé III and Jordan Boyd-Graber}, year = {2017}, url = {https://arxiv.org/abs/1707.07402}, note = {Source identifier: 1707.07402} }