TY - RPRT TI - Learning Online Alignments with Continuous Rewards Policy Gradient AU - Yuping Luo AU - Chung-Cheng Chiu AU - Navdeep Jaitly AU - Ilya Sutskever PY - 2016 UR - https://arxiv.org/abs/1608.01281 ID - 1608.01281 ER -