TY - RPRT TI - Reinforcement Learning for Bandit Neural Machine Translation with Simulated Human Feedback AU - Khanh Nguyen AU - Hal Daumé III AU - Jordan Boyd-Graber PY - 2017 UR - https://arxiv.org/abs/1707.07402 ID - 1707.07402 ER -